本地LLM相關~[01]入門與問題釐清
本地LLM相關~[01]入門與問題釐清
資料來源:AI
一.GGUF介紹
GGUF (GPT-Generated Unified Format) 是一種用於儲存大型語言模型 (LLM) 和 AI 生成模型的檔案格式。它由熱門 C/C++ 推理框架 llama.cpp 的開發者所建立,旨在讓模型載入更快速、推理更有效率,並能完美運行在一般的個人電腦或筆電上。
為什麼 GGUF 如此受歡迎?
01.單一檔案,方便攜帶:傳統模型可能包含多個設定與權重檔,而 GGUF 將模型結構、權重與參數(如 Tokenizer 字典)全部打包在單一的 .gguf 檔案中,極易分享與下載。
02.靈活的模型量化 (Quantization):這是 GGUF 最強大的地方。它能將龐大的模型壓縮為較低的位元數(如 Q4、Q8 等),在犧牲極少精準度的情況下,大幅降低記憶體(VRAM/RAM)需求,讓 16GB 記憶體的普通電腦也能跑動原本需要高等級顯卡的大模型。
03.支援多硬體混合運算:不僅能在 Mac (Apple Silicon)、Windows 筆電的 CPU 上單獨運行,也能將部分運算卸載到 GPU 以加快速度。
常見的使用情境
A.本地大語言模型運行:如果您想在自己的電腦上離線跑 LLaMA、Mistral 等開源模型,最常使用的工具(如 Ollama 或 LM Studio)都是直接讀取並運行 .gguf 格式檔案。
B.圖片生成模型 (AI繪圖):除了文字模型,GGUF 也被廣泛應用於例如 FLUX.1 等大型影像生成模型,透過量化技術大幅降低運算門檻。
若想獲取或測試各種不同精度的 GGUF 模型,您可以直接前往 AI 模型社群 Hugging Face 的搜尋頁面尋找需要的模型版本。
二.GGUF下載
01.下載網址: https://huggingface.co/
02.搜尋語法: 模型名(片段也行) GGUF EX:Qwen3.6-35B-A3B GGUF
三.世界著名模型查詢
01.網址: https://huggingface.co/
02.網址: https://openrouter.ai/models
四.本地運行工具介紹 ~ 除了ollama 外 在LINUX 還有哪些軟體類似工具可以使用 請用表格方式幫我條列其優缺點
01.網址: https://chatgpt.com/share/6a471cc2-ce20-83ee-91ee-fdc939a58fc5
02.網址: https://share.gemini.google/BNkO8vy1yl7D
五.LLM相關問題
A.ollama 架設好 並 載入特定LLM的GGUF 開始使用情況 該LLM模型還會因為使用過程進行訓練或變動嗎? Ans:結論不會
AI回復網址[01]: https://chatgpt.com/share/6a471089-8a28-83e8-a5ad-2f73fdc7eb98
AI回復網址[02]:https://share.gemini.google/8kpmEIKzWJ5r
B.選用那些AI Agent ~ 我要串接本地LLM建立軟體開發團隊和客服團隊 除了 Hermes Agent 外 還有哪些開源免費的AI Agent值得推薦,請納入Hermes Agent依功能優缺點和支援那些作業系統 有系統的列表出來
https://www.meta.ai/share/c/cPl5DtwHkt https://grok.com/share/bGVnYWN5LWNvcHk_e778c9df-f328-45a7-9c11-ceaa318bb1c8 https://www.perplexity.ai/search/ad55e6f8-b16a-4245-9cdb-dfe00251e2c9 https://share.gemini.google/EBEZgme46DSf https://chatgpt.com/share/6a4725a9-4d5c-83e8-83b8-ca63fcc89087
C.按照硬體規格和需求重新發問
我要用下列 硬體規格 建地本地LLM和對應的軟體開發團隊與客服團隊 ●主機主要規格 .品牌:Acer Altos .型號:Altos BrainSphere™ GB10 F1工作站 .主機板晶片組:- .處理器:Arm 20 核心(10× Cortex-X925 + 10× Cortex-A725) .CUDA☆ Cores:6144 .Tensor Core:第五代 .RT Core:第四代 .Tensor 效能:1 PetaFLOP AI 運算效能* *使用稀疏性( sparsity )功能時的理論峰值效能為 4 PFLOPS。 .記憶體容量:128GB LPDDR5x 統一系統記憶體 .固態硬碟:4TB NVMe M.2 具有自加密功能 .圖形處理器(GPU):NVIDIA Grace Blackwell .作業系統:NVIDIA DGX™ OS .主機型態:工作站/迷你電腦 ●其他規格 .音訊輸出:HDMI 多聲道音訊輸出 .網路介面卡 (NIC): NVIDIA ConnectX☆-7 NIC .乙太網路:10GbE .無線網路:Wi-Fi 7 .藍牙:Bluetooth 5.4 with LE .最大功耗:170W .獨家 AI 軟體:Altos aiGeni - 一鍵式 AI 開發工具 ●後端面板 .3 x USB 3.2 Gen 2x2 Type-C 連接埠,20Gbps 傳輸速率,支援 DisplayPort 替代模式 .1 x USB 3.2 Gen 2x2 Type-C 連接埠,支援電力輸入(180W EPR,符合 PD 3.1 規範) .1 x RJ-45 接孔(10GbE) ●後面板視訊埠 .1× HDMI 2.1a ※本商品不含螢幕傳輸線、螢幕轉接頭,請另外購買。 ●機殼規格 .尺寸:150 × 150 × 50 mm(1.13L) .重量:( 1.5 公斤 .鍵盤&滑鼠:無 ●注意事項 .保固說明:安圖斯獨家 3 年安心保固,享隔日到府換機服務 請從 LLM本地伺服器到對應免費開源AI Agent 搭配 有系統的用表格 建議給我 ==== https://www.meta.ai/share/c/7xeghp6vbw https://grok.com/share/bGVnYWN5LWNvcHk_d6f0024b-003f-499c-8cd8-2ded21935d98 https://www.perplexity.ai/search/8fabe55e-30fb-4378-adbd-653d96ddd22d https://share.gemini.google/wtqLkz5zKXRK https://chatgpt.com/share/6a472cba-ab78-83ee-a006-ee2137be97c8
D.ollama /SGLang /vllm /llama.cpp /lm studio 再多AI agent支援/ 在Altos BrainSphere™ GB10 環境的安裝和設定/效能 優缺點比較 以表格呈現
https://www.meta.ai/share/c/SyNaBbjuv3 https://grok.com/share/bGVnYWN5LWNvcHk_bfe5dffd-e5b0-4f0b-9f92-01f1b867be97 https://www.perplexity.ai/search/c863295b-fb8a-4531-acd4-10db85c6324f https://share.gemini.google/fuvZLuZd5Sw9 https://chatgpt.com/share/6a4748bd-0284-83ee-a867-70f6f6d8c609
E.ollama /SGLang /vllm /llama.cpp /lm studio 支援LLM檔案格式和對應LLM檔案取得方式列表 以表格呈現
https://www.meta.ai/share/c/pk6fwdZfL2 https://grok.com/share/bGVnYWN5LWNvcHk_a8b5abc9-dc3c-4465-9af1-d37ba4c31d6c https://www.perplexity.ai/search/80c895be-4eb4-4fd3-a9ce-57b99b6507e8 https://share.gemini.google/ACeeRvsKxdsQ https://chatgpt.com/share/6a474aea-f7a8-83ee-bd96-bcdfcb2c8587
F.以目前硬體規格實現數字員工挑選合適大模型
硬體: Altos BrainSphere™ GB10 我要用vLLM 建立本地大模型 目的如下: 01.AI數字員工[hermes agent] 網站開發 02.AI數字員工[hermes agent] 數位客服 03.AI數字員工[Dify] 數位客服 04,AI數字員工[hermes agent] C# 開發 05.AI短影音自動生成 06.n8n自動工作流 07.AI數字員工[hermes agent]炒股大師 記得考慮併發請求和上述工作所需上下文長度 推薦一個能全部勝任且運作順暢的大模型 https://www.meta.ai/share/c/VR32rBaVOr ~Qwen/Qwen2.5-32B-Instruct-AWQ https://grok.com/share/bGVnYWN5LWNvcHk_5bbf1b0f-bea6-4646-b8cb-f9dac8954631 ~Qwen/Qwen3-32B-Instruct (Qwen3-Coder-32B) https://www.perplexity.ai/search/e4d281fd-f5d3-4f8a-93e5-c186de302dad ~Qwen/Qwen2.5-Coder-32B-Instruct https://share.gemini.google/gb0uvfCq2iBe ~Qwen/Qwen2.5-32B-Instruct-AWQ https://chatgpt.com/share/6a4f2db7-146c-83e8-bc68-d31d482117ab ~Qwen/Qwen3-30B-A3B-Instruct
G.按照F的結果接續詢問Qwen3.6-35B-A3B為何沒入選
Qwen3.6-35B-A3B 模型能順暢執行嗎 https://huggingface.co/Qwen/Qwen3.6-35B-A3B 為何不推薦 https://www.meta.ai/share/c/VR32rBaVOr ~Qwen2.5-32B-AWQ https://grok.com/share/bGVnYWN5LWNvcHk_26191149-5853-4d29-b778-a36a9d416d40 ~Qwen/Qwen3.6-35B-A3B https://www.perplexity.ai/search/ying-ti-altos-brainspheretm-gb-5NKB_fXTT4qT5cGG3jAtrQ ~Qwen2.5-Coder-32B-Instruct https://share.gemini.google/t2V5KuSqDJBD ~Qwen2.5-32B-Instruct https://chatgpt.com/share/6a4f516d-0580-83ee-bba7-0505af919f36 ~Qwen/Qwen3.6-35B-A3B
10 thoughts on “本地LLM相關~[01]入門與問題釐清”
AMD Ryzen AI Halo採用旗艦Strix Halo SoC(Ryzen AI MAX+ 395),規格包括:
電玩16核心 / 32執行緒(Zen 5架構)
Radeon 8060S內顯(40組RDNA 3.5運算單元)
50 TOPS XDNA 2 NPU
最高120W TDP
系統配備128GB LPDDR5X-8000記憶體,以及2TB PCIe Gen4x4 SSD儲存
就上述硬體
除了ollama 外 在LINUX 還有哪些軟體類似工具可以使用支援多Ai Agent呼叫 請用表格方式幫我條列其優缺點
https://www.meta.ai/share/c/OOBq3gjDlP
https://grok.com/share/bGVnYWN5LWNvcHk_c8853623-1ad9-412c-8fe0-96115b5f051d
https://www.perplexity.ai/search/2efbe64c-31a8-4640-b49a-fd8817fa56eb
https://share.gemini.google/N86tBaXBlPzv
https://chatgpt.com/share/6a4752d7-37a0-83ee-824c-5295fb01a548
硬體: AMD Ryzen AI Max+ 395
作業系統:WINDOWS11
要透過 VLLM 建立本地大模型 給 hermes agent 使用
請依照 發揮硬體最大效能和日後系統維護性 給出完整的建置流程
https://www.meta.ai/share/c/Z1mmdHvYGH
https://grok.com/share/bGVnYWN5LWNvcHk_7fa2771b-0418-4ec3-ae84-decbf238578d
https://www.perplexity.ai/search/5823af9c-b625-4ffa-8382-16d771631e5b
https://share.gemini.google/Yse23Mgi0cL0
https://chatgpt.com/share/6a4efb25-c7c0-83ee-8163-173c853eb486
硬體: AMD Ryzen AI Max+ 395
我要用vLLM 建立本地大模型 目的如下:
01.AI數字員工[hermes agent] 網站開發
02.AI數字員工[hermes agent] 數位客服
03.AI數字員工[Dify] 數位客服
04,AI數字員工[hermes agent] C# 開發
05.AI短影音自動生成
06.n8n自動工作流
07.AI數字員工[hermes agent]炒股大師
記得考慮併發請求和上述工作所需上下文長度 推薦一個能全部勝任且運作順暢的大模型
https://www.meta.ai/share/c/6JY6B1NUy8 ~ Qwen/Qwen2.5-32B-Instruct-AWQ
https://grok.com/share/bGVnYWN5LWNvcHk_081bc932-ac2c-4a0c-9a2b-cde543b3dba0 ~ Qwen/Qwen3.6-35B-A3B-Instruct
https://www.perplexity.ai/search/60b96ea3-8368-43ef-8728-9ccc507f35f2 ~ Qwen/Qwen3-Coder-30B-A3B-Instruct
https://share.gemini.google/te5skoXaKpMt ~ Qwen/Qwen2.5-32B-Instruct-AWQ
https://chatgpt.com/share/6a4f2a11-51ac-83ee-b2c0-0436a9da06c1 ~ Qwen/Qwen3.5-35B-A3B-AWQ
硬體: Altos BrainSphere™ GB10 和 AMD Ryzen AI Max+ 395
我要用vLLM 建立本地大模型 目的如下:
01.AI數字員工[hermes agent] 網站開發
02.AI數字員工[hermes agent] 數位客服
03.AI數字員工[Dify] 數位客服
04,AI數字員工[hermes agent] C# 開發
05.AI短影音自動生成
06.n8n自動工作流
07.AI數字員工[hermes agent]炒股大師
記得考慮併發請求和上述工作所需上下文長度 推薦一個能全部勝任且運作順暢的大模型
並且一樣使用的模型下 使用表格呈現比較其兩硬體性能差異
https://www.meta.ai/share/c/8rKVX40oSr ~Qwen/Qwen2.5-72B-Instruct-GPTQ-Int4 [7併發 VS 2併發]
https://grok.com/share/bGVnYWN5LWNvcHk_e97ceb54-37b7-43a5-9397-3acf67b17477 ~Qwen/Qwen3-32B-Instruct
https://www.perplexity.ai/search/f9a318f6-276a-459e-8961-78e91781e358 ~Qwen/Qwen3-32B-Instruct
https://share.gemini.google/20A9n50NmwCL ~Qwen/Qwen2.5-32B-Instruct-AWQ
https://chatgpt.com/share/6a4f3e7d-93bc-83ee-aa36-e9d05c586395 ~Qwen3.5-35B-A3B-Instruct-AWQ
Qwen3.6-35B-A3B 模型能在 硬體: AMD Ryzen AI Max+ 395 上順暢執行嗎
https://huggingface.co/Qwen/Qwen3.6-35B-A3B
https://www.meta.ai/share/c/6JY6B1NUy8 ~Qwen/Qwen3.5-35B-A3B-GPTQ-Int4
https://grok.com/share/bGVnYWN5LWNvcHk_9ebe1337-30a9-4c14-a159-8d0ce1c02f9b ~Qwen/Qwen3.6-35B-A3B-Instruct
https://www.perplexity.ai/search/60b96ea3-8368-43ef-8728-9ccc507f35f2 ~Qwen/Qwen3-Coder-30B-A3B-Instruct
https://share.gemini.google/0mqbRc4FEpSq ~Qwen/Qwen3.6-35B-A3B-Instruct-AWQ
https://chatgpt.com/share/6a4f4bca-b848-83e9-b9ef-0c56aec5b80c ~Qwen/Qwen3.6-35B-A3B
别再用 Ollama 了!OpenClaw 秒级响应方案(vLLM + 本地模型)完全免费!| 零度解说
對應文件:
https://www.freedidi.com/23445.html
Local LLM infra & Inference ~ vLLM docker 安裝 [一系列文章]
https://ithelp.ithome.com.tw/users/20168115/ironman/7508
2026本地大模型推理架構五強深度比較:vLLM、SGLang、llama.cpp、MLX與Ollama選型指南
硬體: AMD Ryzen AI Max+ 395
我要用vLLM 建立本地大模型 目的如下:
01.AI數字員工[hermes agent] 網站開發
02.AI數字員工[hermes agent] 數位客服
03.AI數字員工[Dify] 數位客服
04,AI數字員工[hermes agent] C# 開發
05.AI短影音自動生成
06.n8n自動工作流
07.AI數字員工[hermes agent]炒股大師
下面這幾套工具 vLLM、SGLang、llama.cpp、MLX與Ollama 你推薦哪一套最合適
AMD有支援vLLM的相關套件嗎
https://www.meta.ai/share/c/17vdKRV0kd ~llama.cpp
https://grok.com/share/bGVnYWN5LWNvcHk_023d19bb-86a9-4b57-a253-60bd968551ee ~Ollama -> ~vLLM
https://www.perplexity.ai/search/ying-ti-amd-ryzen-ai-max-395-w-qXoDrm_kS9.ynuVqD3FnJw ~vLLM
https://share.gemini.google/ztpLTYZ4rcPj ~vLLM
https://chatgpt.com/share/6a506216-41dc-83ee-961c-da78d88e5ab4 ~vLLM