本地LLM相關~[01]入門與問題釐清

本地LLM相關~[01]入門與問題釐清

本地LLM相關~[01]入門與問題釐清


資料來源:AI


一.GGUF介紹

    GGUF (GPT-Generated Unified Format) 是一種用於儲存大型語言模型 (LLM) 和 AI 生成模型的檔案格式。它由熱門 C/C++ 推理框架 llama.cpp 的開發者所建立,旨在讓模型載入更快速、推理更有效率,並能完美運行在一般的個人電腦或筆電上。 


    為什麼 GGUF 如此受歡迎?

        01.單一檔案,方便攜帶:傳統模型可能包含多個設定與權重檔,而 GGUF 將模型結構、權重與參數(如 Tokenizer 字典)全部打包在單一的 .gguf 檔案中,極易分享與下載。 

        02.靈活的模型量化 (Quantization):這是 GGUF 最強大的地方。它能將龐大的模型壓縮為較低的位元數(如 Q4、Q8 等),在犧牲極少精準度的情況下,大幅降低記憶體(VRAM/RAM)需求,讓 16GB 記憶體的普通電腦也能跑動原本需要高等級顯卡的大模型。 

        03.支援多硬體混合運算:不僅能在 Mac (Apple Silicon)、Windows 筆電的 CPU 上單獨運行,也能將部分運算卸載到 GPU 以加快速度。 


    常見的使用情境
        A.本地大語言模型運行:如果您想在自己的電腦上離線跑 LLaMA、Mistral 等開源模型,最常使用的工具(如 Ollama 或 LM Studio)都是直接讀取並運行 .gguf 格式檔案。 

        B.圖片生成模型 (AI繪圖):除了文字模型,GGUF 也被廣泛應用於例如 FLUX.1 等大型影像生成模型,透過量化技術大幅降低運算門檻。 

    若想獲取或測試各種不同精度的 GGUF 模型,您可以直接前往 AI 模型社群 Hugging Face 的搜尋頁面尋找需要的模型版本。



二.GGUF下載

    01.下載網址: https://huggingface.co/
    02.搜尋語法: 模型名(片段也行) GGUF  EX:Qwen3.6-35B-A3B GGUF


三.世界著名模型查詢

    01.網址: https://huggingface.co/

    02.網址: https://openrouter.ai/models


四.本地運行工具介紹 ~ 除了ollama 外 在LINUX 還有哪些軟體類似工具可以使用 請用表格方式幫我條列其優缺點

    01.網址: https://chatgpt.com/share/6a471cc2-ce20-83ee-91ee-fdc939a58fc5

    02.網址: https://share.gemini.google/BNkO8vy1yl7D


五.LLM相關問題

    A.ollama 架設好 並 載入特定LLM的GGUF 開始使用情況 該LLM模型還會因為使用過程進行訓練或變動嗎? Ans:結論不會
         AI回復網址[01]: https://chatgpt.com/share/6a471089-8a28-83e8-a5ad-2f73fdc7eb98

         AI回復網址[02]:https://share.gemini.google/8kpmEIKzWJ5r

    

    B.選用那些AI Agent ~ 我要串接本地LLM建立軟體開發團隊和客服團隊 除了 Hermes Agent 外 還有哪些開源免費的AI Agent值得推薦,請納入Hermes Agent依功能優缺點和支援那些作業系統 有系統的列表出來

https://www.meta.ai/share/c/cPl5DtwHkt

https://grok.com/share/bGVnYWN5LWNvcHk_e778c9df-f328-45a7-9c11-ceaa318bb1c8

https://www.perplexity.ai/search/ad55e6f8-b16a-4245-9cdb-dfe00251e2c9

https://share.gemini.google/EBEZgme46DSf

https://chatgpt.com/share/6a4725a9-4d5c-83e8-83b8-ca63fcc89087


    C.按照硬體規格和需求重新發問

我要用下列 硬體規格 建地本地LLM和對應的軟體開發團隊與客服團隊
●主機主要規格
.品牌:Acer Altos
.型號:Altos BrainSphere™ GB10 F1工作站
.主機板晶片組:-
.處理器:Arm 20 核心(10× Cortex-X925 + 10× Cortex-A725)
.CUDA☆ Cores:6144
.Tensor Core:第五代
.RT Core:第四代
.Tensor 效能:1 PetaFLOP AI 運算效能*
*使用稀疏性( sparsity )功能時的理論峰值效能為 4 PFLOPS。
.記憶體容量:128GB LPDDR5x 統一系統記憶體
.固態硬碟:4TB NVMe M.2 具有自加密功能
.圖形處理器(GPU):NVIDIA Grace Blackwell
.作業系統:NVIDIA DGX™ OS
.主機型態:工作站/迷你電腦
●其他規格
.音訊輸出:HDMI 多聲道音訊輸出
.網路介面卡 (NIC): NVIDIA ConnectX☆-7 NIC
.乙太網路:10GbE
.無線網路:Wi-Fi 7
.藍牙:Bluetooth 5.4 with LE
.最大功耗:170W
.獨家 AI 軟體:Altos aiGeni - 一鍵式 AI 開發工具
●後端面板
.3 x USB 3.2 Gen 2x2 Type-C 連接埠,20Gbps 傳輸速率,支援 DisplayPort 替代模式
.1 x USB 3.2 Gen 2x2 Type-C 連接埠,支援電力輸入(180W EPR,符合 PD 3.1 規範)
.1 x RJ-45 接孔(10GbE)
●後面板視訊埠
.1× HDMI 2.1a
※本商品不含螢幕傳輸線、螢幕轉接頭,請另外購買。
●機殼規格
.尺寸:150 × 150 × 50 mm(1.13L)
.重量:( 1.5 公斤
.鍵盤&滑鼠:無
●注意事項
.保固說明:安圖斯獨家 3 年安心保固,享隔日到府換機服務

請從 LLM本地伺服器到對應免費開源AI Agent 搭配 有系統的用表格 建議給我

====

https://www.meta.ai/share/c/7xeghp6vbw

https://grok.com/share/bGVnYWN5LWNvcHk_d6f0024b-003f-499c-8cd8-2ded21935d98

https://www.perplexity.ai/search/8fabe55e-30fb-4378-adbd-653d96ddd22d

https://share.gemini.google/wtqLkz5zKXRK

https://chatgpt.com/share/6a472cba-ab78-83ee-a006-ee2137be97c8


    D.ollama /SGLang /vllm /llama.cpp /lm studio 再多AI agent支援/ 在Altos BrainSphere™ GB10 環境的安裝和設定/效能 優缺點比較 以表格呈現

https://www.meta.ai/share/c/SyNaBbjuv3

https://grok.com/share/bGVnYWN5LWNvcHk_bfe5dffd-e5b0-4f0b-9f92-01f1b867be97

https://www.perplexity.ai/search/c863295b-fb8a-4531-acd4-10db85c6324f

https://share.gemini.google/fuvZLuZd5Sw9

https://chatgpt.com/share/6a4748bd-0284-83ee-a867-70f6f6d8c609


    E.ollama /SGLang /vllm /llama.cpp /lm studio  支援LLM檔案格式和對應LLM檔案取得方式列表 以表格呈現

https://www.meta.ai/share/c/pk6fwdZfL2

https://grok.com/share/bGVnYWN5LWNvcHk_a8b5abc9-dc3c-4465-9af1-d37ba4c31d6c

https://www.perplexity.ai/search/80c895be-4eb4-4fd3-a9ce-57b99b6507e8

https://share.gemini.google/ACeeRvsKxdsQ

https://chatgpt.com/share/6a474aea-f7a8-83ee-bd96-bcdfcb2c8587


    F.以目前硬體規格實現數字員工挑選合適大模型

硬體: Altos BrainSphere™ GB10
我要用vLLM 建立本地大模型 目的如下:
01.AI數字員工[hermes agent] 網站開發
02.AI數字員工[hermes agent] 數位客服
03.AI數字員工[Dify] 數位客服
04,AI數字員工[hermes agent] C# 開發
05.AI短影音自動生成
06.n8n自動工作流
07.AI數字員工[hermes agent]炒股大師
記得考慮併發請求和上述工作所需上下文長度 推薦一個能全部勝任且運作順暢的大模型 

https://www.meta.ai/share/c/VR32rBaVOr ~Qwen/Qwen2.5-32B-Instruct-AWQ

https://grok.com/share/bGVnYWN5LWNvcHk_5bbf1b0f-bea6-4646-b8cb-f9dac8954631 ~Qwen/Qwen3-32B-Instruct (Qwen3-Coder-32B)

https://www.perplexity.ai/search/e4d281fd-f5d3-4f8a-93e5-c186de302dad ~Qwen/Qwen2.5-Coder-32B-Instruct

https://share.gemini.google/gb0uvfCq2iBe ~Qwen/Qwen2.5-32B-Instruct-AWQ

https://chatgpt.com/share/6a4f2db7-146c-83e8-bc68-d31d482117ab ~Qwen/Qwen3-30B-A3B-Instruct


    G.按照F的結果接續詢問Qwen3.6-35B-A3B為何沒入選

Qwen3.6-35B-A3B 模型能順暢執行嗎
https://huggingface.co/Qwen/Qwen3.6-35B-A3B
為何不推薦


https://www.meta.ai/share/c/VR32rBaVOr ~Qwen2.5-32B-AWQ

https://grok.com/share/bGVnYWN5LWNvcHk_26191149-5853-4d29-b778-a36a9d416d40 ~Qwen/Qwen3.6-35B-A3B

https://www.perplexity.ai/search/ying-ti-altos-brainspheretm-gb-5NKB_fXTT4qT5cGG3jAtrQ ~Qwen2.5-Coder-32B-Instruct

https://share.gemini.google/t2V5KuSqDJBD ~Qwen2.5-32B-Instruct

https://chatgpt.com/share/6a4f516d-0580-83ee-bba7-0505af919f36 ~Qwen/Qwen3.6-35B-A3B

10 thoughts on “本地LLM相關~[01]入門與問題釐清

  1. AMD Ryzen AI Halo採用旗艦Strix Halo SoC(Ryzen AI MAX+ 395),規格包括:

    電玩16核心 / 32執行緒(Zen 5架構)
    Radeon 8060S內顯(40組RDNA 3.5運算單元)
    50 TOPS XDNA 2 NPU
    最高120W TDP
    系統配備128GB LPDDR5X-8000記憶體,以及2TB PCIe Gen4x4 SSD儲存

    就上述硬體

    除了ollama 外 在LINUX 還有哪些軟體類似工具可以使用支援多Ai Agent呼叫 請用表格方式幫我條列其優缺點


    https://www.meta.ai/share/c/OOBq3gjDlP

    https://grok.com/share/bGVnYWN5LWNvcHk_c8853623-1ad9-412c-8fe0-96115b5f051d

    https://www.perplexity.ai/search/2efbe64c-31a8-4640-b49a-fd8817fa56eb

    https://share.gemini.google/N86tBaXBlPzv

    https://chatgpt.com/share/6a4752d7-37a0-83ee-824c-5295fb01a548

    1. 硬體: AMD Ryzen AI Max+ 395
      作業系統:WINDOWS11
      要透過 VLLM 建立本地大模型 給 hermes agent 使用
      請依照 發揮硬體最大效能和日後系統維護性 給出完整的建置流程


      https://www.meta.ai/share/c/Z1mmdHvYGH
      https://grok.com/share/bGVnYWN5LWNvcHk_7fa2771b-0418-4ec3-ae84-decbf238578d
      https://www.perplexity.ai/search/5823af9c-b625-4ffa-8382-16d771631e5b
      https://share.gemini.google/Yse23Mgi0cL0
      https://chatgpt.com/share/6a4efb25-c7c0-83ee-8163-173c853eb486

    2. 硬體: AMD Ryzen AI Max+ 395
      我要用vLLM 建立本地大模型 目的如下:
      01.AI數字員工[hermes agent] 網站開發
      02.AI數字員工[hermes agent] 數位客服
      03.AI數字員工[Dify] 數位客服
      04,AI數字員工[hermes agent] C# 開發
      05.AI短影音自動生成
      06.n8n自動工作流
      07.AI數字員工[hermes agent]炒股大師
      記得考慮併發請求和上述工作所需上下文長度 推薦一個能全部勝任且運作順暢的大模型

      https://www.meta.ai/share/c/6JY6B1NUy8 ~ Qwen/Qwen2.5-32B-Instruct-AWQ

      https://grok.com/share/bGVnYWN5LWNvcHk_081bc932-ac2c-4a0c-9a2b-cde543b3dba0 ~ Qwen/Qwen3.6-35B-A3B-Instruct

      https://www.perplexity.ai/search/60b96ea3-8368-43ef-8728-9ccc507f35f2 ~ Qwen/Qwen3-Coder-30B-A3B-Instruct

      https://share.gemini.google/te5skoXaKpMt ~ Qwen/Qwen2.5-32B-Instruct-AWQ

      https://chatgpt.com/share/6a4f2a11-51ac-83ee-b2c0-0436a9da06c1 ~ Qwen/Qwen3.5-35B-A3B-AWQ

    3. 硬體: Altos BrainSphere™ GB10 和 AMD Ryzen AI Max+ 395
      我要用vLLM 建立本地大模型 目的如下:
      01.AI數字員工[hermes agent] 網站開發
      02.AI數字員工[hermes agent] 數位客服
      03.AI數字員工[Dify] 數位客服
      04,AI數字員工[hermes agent] C# 開發
      05.AI短影音自動生成
      06.n8n自動工作流
      07.AI數字員工[hermes agent]炒股大師
      記得考慮併發請求和上述工作所需上下文長度 推薦一個能全部勝任且運作順暢的大模型
      並且一樣使用的模型下 使用表格呈現比較其兩硬體性能差異


      https://www.meta.ai/share/c/8rKVX40oSr ~Qwen/Qwen2.5-72B-Instruct-GPTQ-Int4 [7併發 VS 2併發]

      https://grok.com/share/bGVnYWN5LWNvcHk_e97ceb54-37b7-43a5-9397-3acf67b17477 ~Qwen/Qwen3-32B-Instruct

      https://www.perplexity.ai/search/f9a318f6-276a-459e-8961-78e91781e358 ~Qwen/Qwen3-32B-Instruct

      https://share.gemini.google/20A9n50NmwCL ~Qwen/Qwen2.5-32B-Instruct-AWQ

      https://chatgpt.com/share/6a4f3e7d-93bc-83ee-aa36-e9d05c586395 ~Qwen3.5-35B-A3B-Instruct-AWQ

    4. Qwen3.6-35B-A3B 模型能在 硬體: AMD Ryzen AI Max+ 395 上順暢執行嗎


      https://huggingface.co/Qwen/Qwen3.6-35B-A3B

      https://www.meta.ai/share/c/6JY6B1NUy8 ~Qwen/Qwen3.5-35B-A3B-GPTQ-Int4

      https://grok.com/share/bGVnYWN5LWNvcHk_9ebe1337-30a9-4c14-a159-8d0ce1c02f9b ~Qwen/Qwen3.6-35B-A3B-Instruct
      https://www.perplexity.ai/search/60b96ea3-8368-43ef-8728-9ccc507f35f2 ~Qwen/Qwen3-Coder-30B-A3B-Instruct

      https://share.gemini.google/0mqbRc4FEpSq ~Qwen/Qwen3.6-35B-A3B-Instruct-AWQ
      https://chatgpt.com/share/6a4f4bca-b848-83e9-b9ef-0c56aec5b80c ~Qwen/Qwen3.6-35B-A3B

  2. 别再用 Ollama 了!OpenClaw 秒级响应方案(vLLM + 本地模型)完全免费!| 零度解说

  3. 2026本地大模型推理架構五強深度比較:vLLM、SGLang、llama.cpp、MLX與Ollama選型指南

    1. 硬體: AMD Ryzen AI Max+ 395
      我要用vLLM 建立本地大模型 目的如下:
      01.AI數字員工[hermes agent] 網站開發
      02.AI數字員工[hermes agent] 數位客服
      03.AI數字員工[Dify] 數位客服
      04,AI數字員工[hermes agent] C# 開發
      05.AI短影音自動生成
      06.n8n自動工作流
      07.AI數字員工[hermes agent]炒股大師

      下面這幾套工具 vLLM、SGLang、llama.cpp、MLX與Ollama 你推薦哪一套最合適

      AMD有支援vLLM的相關套件嗎


      https://www.meta.ai/share/c/17vdKRV0kd ~llama.cpp

      https://grok.com/share/bGVnYWN5LWNvcHk_023d19bb-86a9-4b57-a253-60bd968551ee ~Ollama -> ~vLLM

      https://www.perplexity.ai/search/ying-ti-amd-ryzen-ai-max-395-w-qXoDrm_kS9.ynuVqD3FnJw ~vLLM

      https://share.gemini.google/ztpLTYZ4rcPj ~vLLM

      https://chatgpt.com/share/6a506216-41dc-83ee-961c-da78d88e5ab4 ~vLLM

發表迴響

你的電子郵件位址並不會被公開。 必要欄位標記為 *