下載比顯卡小的模型但是ollama卻全部都在主記憶體執行
下載比顯卡小的模型但是ollama卻全部都在主記憶體執行
AI提問:
我從 https://huggingface.co/unsloth/DeepSeek-R1-0528-Qwen3-8B-GGUF 下載 DeepSeek-R1-0528-Qwen3-8B-UD-Q4_K_XL.gguf 模型實體檔案大小:5.12GB 我的設備有8G顯卡 使用 ollama 載入 為何會全部都在主記憶體執行 PS. 我測過 https://huggingface.co/unsloth/gemma-4-12b-it-GGUF 的 gemma-4-12b-it-UD-Q4_K_XL.gguf 可以正常利用顯卡工作
AI回復:
https://www.meta.ai/share/c/2pmfAepfUB?utm_source=meta_ai_web_share_copy_link&utm_medium=share&utm_campaign=ecto_share https://grok.com/share/bGVnYWN5LWNvcHk_e4d5ef4b-0168-47b6-b800-b04eba81deb9 https://www.perplexity.ai/search/wo-cong-https-huggingface-co-u-d6s6Ps3fTj6sLElTLv.KKg https://gemini.google.com/share/5132194a39e9 https://chatgpt.com/share/6a2783a7-3764-8324-8c65-0b976b8012ce
條列整理回復:
01.更新ollama
02.使用指令 強制指定使用GPU
03.使用指令 降低content大小
03.下載非UD模型
相關指令(命令)備份[自定義 modelfile.txt]:
FROM DeepSeek-R1-0528-Qwen3-8B-UD-Q4_K_XL.gguf PARAMETER num_gpu 999 # 盡量全 offload 到 GPU PARAMETER num_ctx 4096 # 或更小,省 KV cache PARAMETER num_batch 512 # 設為 批次處理 512 個 token # 掛載命令: ollama create my-deepseek -f modelfile.txt
6 thoughts on “下載比顯卡小的模型但是ollama卻全部都在主記憶體執行”
LLM 本地運行
下載比顯卡小的大語言模型(GGUF) 但是ollama卻全部都在主記憶體執行
Qwen3.6-35B-A3B: 第一个真正能干活的本地开源模型!3 台不同设备的本地部署实战!
Qwen 3.6 35B 8GB VRAM + 32G主記憶體 給我lm studio 設定 目標 驅動 hermes Agent使用
https://www.meta.ai/share/c/fxI71LkXGB
https://grok.com/share/bGVnYWN5LWNvcHk_f59e34cd-e595-4964-b4dd-29e6a324a414
https://gemini.google.com/share/84628ac8d349
https://chatgpt.com/share/6a29319d-6604-83ab-83e1-1b79fb734d79
8G顯存本地跑12B多模態!中英截圖OCR 98%、報錯圖直接給指令| Gemma 4 12B
LM Studio + 自行手動下載模型 使用教學
https://aidiscovery2045.notion.site/8G-12B-Gemma-4-12B-37a0720c6766802d9081e9351a7ad5a4
# 8G顯存跑12B多模態|Gemma 4 12B
– LM Studio
– Gemma 4 12B 量化版
– LLama.cpp(可選)
—
## 第一步 安裝 LM Studio
默認安裝即可。
## 第二步 下載模型
如果你是8G顯存
不推薦LM Studio里的Q4 量化版
打開下面地址:
https://huggingface.co/unsloth/gemma-4-12b-it-GGUF/tree/main
下載兩個文件
gemma-4-12b-it-UD-Q3_K_XL.gguf
mmproj-BF16.gguf
## 第三步 把模型放入LM Studio目錄
關閉LM Studio。
依次進入 C盤—>用戶—>—>.lmstudion
看是否有models目錄,沒有則新建
進入models目錄,繼續新建
lmstudio-community
進入lmstudio-community,繼續新建
gemma-4-12B-it-GGUF
進入gemma-4-12B-it-GGUF,把兩個模型文件移進來
gemma-4-12b-it-UD-Q3_K_XL.gguf mmproj-BF16.gguf
mmproj-BF16.gguf 改名為 mmproj-gemma-4-12B-it-BF16.gguf
配置好的完整截圖如下:
!image.png
運行LM Studio,聊天框下面選模型,Gemma 4 12B
上下文長度默認4096,寫代碼不夠,建議調到8192
GPU 卸載直接拉滿48,K快取量化類型 鉤選,選Q8_0
其他參數全部默認,加載模型,本地即可使用
gemma-4-12b-it-UD-Q3_K_XL.gguf + LM Studio 支援 工具呼叫(Tool Calling) 設定
https://gemini.google.com/share/510764d84fdb