下載比顯卡小的模型但是ollama卻全部都在主記憶體執行

下載比顯卡小的模型但是ollama卻全部都在主記憶體執行

下載比顯卡小的模型但是ollama卻全部都在主記憶體執行


AI提問:

我從 https://huggingface.co/unsloth/DeepSeek-R1-0528-Qwen3-8B-GGUF 下載 DeepSeek-R1-0528-Qwen3-8B-UD-Q4_K_XL.gguf

模型實體檔案大小:5.12GB

我的設備有8G顯卡 使用 ollama 載入 為何會全部都在主記憶體執行

PS. 我測過 https://huggingface.co/unsloth/gemma-4-12b-it-GGUF 的 gemma-4-12b-it-UD-Q4_K_XL.gguf 可以正常利用顯卡工作


AI回復:

https://www.meta.ai/share/c/2pmfAepfUB?utm_source=meta_ai_web_share_copy_link&utm_medium=share&utm_campaign=ecto_share
https://grok.com/share/bGVnYWN5LWNvcHk_e4d5ef4b-0168-47b6-b800-b04eba81deb9

https://www.perplexity.ai/search/wo-cong-https-huggingface-co-u-d6s6Ps3fTj6sLElTLv.KKg
https://gemini.google.com/share/5132194a39e9

https://chatgpt.com/share/6a2783a7-3764-8324-8c65-0b976b8012ce


條列整理回復:

    01.更新ollama
    02.使用指令 強制指定使用GPU
    03.使用指令 降低content大小
    03.下載非UD模型


相關指令(命令)備份[自定義 modelfile.txt]:

FROM DeepSeek-R1-0528-Qwen3-8B-UD-Q4_K_XL.gguf

PARAMETER num_gpu 999     # 盡量全 offload 到 GPU
PARAMETER num_ctx 4096    # 或更小,省 KV cache
PARAMETER num_batch 512   # 設為 批次處理 512 個 token

# 掛載命令: ollama create my-deepseek -f modelfile.txt

6 thoughts on “下載比顯卡小的模型但是ollama卻全部都在主記憶體執行

  1. LLM 本地運行
    下載比顯卡小的大語言模型(GGUF) 但是ollama卻全部都在主記憶體執行

  2. Qwen3.6-35B-A3B: 第一个真正能干活的本地开源模型!3 台不同设备的本地部署实战!

  3. Qwen 3.6 35B 8GB VRAM + 32G主記憶體 給我lm studio 設定 目標 驅動 hermes Agent使用


    https://www.meta.ai/share/c/fxI71LkXGB
    https://grok.com/share/bGVnYWN5LWNvcHk_f59e34cd-e595-4964-b4dd-29e6a324a414
    https://gemini.google.com/share/84628ac8d349
    https://chatgpt.com/share/6a29319d-6604-83ab-83e1-1b79fb734d79

  4. 8G顯存本地跑12B多模態!中英截圖OCR 98%、報錯圖直接給指令| Gemma 4 12B
    LM Studio + 自行手動下載模型 使用教學


    https://aidiscovery2045.notion.site/8G-12B-Gemma-4-12B-37a0720c6766802d9081e9351a7ad5a4

    1. # 8G顯存跑12B多模態|Gemma 4 12B

      – LM Studio
      – Gemma 4 12B 量化版
      – LLama.cpp(可選)

      ## 第一步 安裝 LM Studio

      默認安裝即可。

      ## 第二步 下載模型

      如果你是8G顯存

      不推薦LM Studio里的Q4 量化版

      打開下面地址:

      https://huggingface.co/unsloth/gemma-4-12b-it-GGUF/tree/main

      下載兩個文件

      gemma-4-12b-it-UD-Q3_K_XL.gguf

      mmproj-BF16.gguf

      ## 第三步 把模型放入LM Studio目錄

      關閉LM Studio。

      依次進入 C盤—>用戶—>—>.lmstudion

      看是否有models目錄,沒有則新建

      進入models目錄,繼續新建

      lmstudio-community

      進入lmstudio-community,繼續新建

      gemma-4-12B-it-GGUF

      進入gemma-4-12B-it-GGUF,把兩個模型文件移進來

      gemma-4-12b-it-UD-Q3_K_XL.gguf mmproj-BF16.gguf

      mmproj-BF16.gguf 改名為 mmproj-gemma-4-12B-it-BF16.gguf

      配置好的完整截圖如下:

      !image.png

      運行LM Studio,聊天框下面選模型,Gemma 4 12B

      上下文長度默認4096,寫代碼不夠,建議調到8192

      GPU 卸載直接拉滿48,K快取量化類型 鉤選,選Q8_0

      其他參數全部默認,加載模型,本地即可使用

發表迴響

你的電子郵件位址並不會被公開。 必要欄位標記為 *