資訊設備大小事

510GB 模型塞進 128GB:DGX Spark 跑 DeepSeek V4.1 Flash 的完整方法

2026-09-16
桌上型 AI 電腦與 NVMe SSD 模組|蓋斯克科技
DeepSeek V4.1 Flash 是 510GB 的 MoE 模型,單台 DGX Spark 只有 128GB,但社群用 expert streaming 技術把它跑起來了,速度從 15 tok/s 在 24 小時內優化到 32 tok/s。解釋技術原理、三種配置(1x/2x/4x)的實測數字,以及你現在就可以用的 GitHub repo。

DeepSeek V4.1 Flash 是 510GB 的 MoE 模型,你的 DGX Spark 只有 128GB。按照直覺這不可能跑,但社群在 2026 年 9 月用 expert streaming 技術把它跑起來了,單台速度在同一天內從 15.2 tok/s 優化到 20.85 tok/s。這篇解釋技術原理,以及你需要什麼配置才能跑起來。

這篇要說清楚三件事:expert streaming 怎麼運作、單台 vs 多台跑 DeepSeek V4.1 Flash 的效能差距有多大、你現在就可以試的 GitHub repo 在哪裡。

桌上型 AI 電腦與 NVMe SSD 特寫|蓋斯克科技

這篇適合誰看

  • 已有 DGX Spark,想在上面跑最強的開源模型
  • 聽過 DeepSeek V4.1 Flash 但不知道怎麼在 128GB 機器上跑
  • 評估是否需要加購第二台來跑完整版
  • 對 MoE expert routing 技術有興趣的工程師

510GB 塞進 128GB:Expert Streaming 原理

DeepSeek V4.1 Flash 專家串流架構圖|蓋斯克科技

DeepSeek V4.1 Flash 是 MoE(Mixture of Experts)架構,理論上有 384 個 expert,但每個 token 只激活其中 6 個。這意味著你不需要把所有 384 個 expert 都放進 RAM,只需要常駐最常用的 expert,其他的按需從 NVMe SSD 串流讀入。

用戶 0xBakeer 在 GitHub 開源的 deepseek-v41-flash-spark 專案,實作了「resident hot experts + NVMe streaming」架構:讓模型告訴你什麼工作需要哪些 expert,只常駐那些 expert(約佔 25.6% expert set),其餘從 NVMe 按需載入。2026 年 9 月 11 日當天從 15.2 tok/s 優化到 20.85 tok/s,9 月 14 日作者展示了單台開 256K context 的版本。資料來源:GitHub 0xBakeer/deepseek-v41-flash-spark、X @0xBakeer。

三種配置的實際效能數字

DeepSeek V4.1 Flash 一、二、四台 DGX Spark 效能比較圖|蓋斯克科技
配置方式Token 生成速度Context備註
1x DGX SparkNVMe expert streaming(25.6% 常駐)15.2–20.85 tok/s32,768–256K(依設定)速度持續優化中
2x DGX Spark(TP=2)全 expert 常駐32 tok/s 單串 / 42 tok/s 並發600,000600k KV cache 可用
4x DGX Spark(TP=4)vLLM TP4 全速84.9 tok/s(數學)/ 65.3 tok/s(程式碼)1M+需 400G 交換機

現在就可以開始的方式

單台 DGX Spark 部署 DeepSeek V4.1 Flash 步驟圖|蓋斯克科技

如果你有單台 DGX Spark,最快的起始方式是用 0xBakeer 的 repo:

git clone https://github.com/0xBakeer/deepseek-v41-flash-spark
cd deepseek-v41-flash-spark
# 依照 README 設定 expert 常駐比例
# 建議從 MAX_SEQ=32768、25.6% resident 開始

關鍵設定項目是 resident expert 比例和 MAX_SEQ。resident 比例越高,RAM 佔用越多但速度越快;MAX_SEQ 越大,context window 越長但記憶體剩給 expert 越少。

結論

510GB 模型在 128GB 機器上跑得起來,而且速度仍在快速優化。單台已可用於開發和實驗,兩台才是完整體驗 DeepSeek V4.1 Flash 的配置(一台與兩台的差別)。如果你的應用需要 frontier-level 模型推論且資料不能出機房,這是目前最可行的本機方案。

立即開始:在自己的機房跑 frontier 模型

蓋斯克科技協助企業在地端跑大型 MoE 模型,從硬體、儲存到推論框架一起規劃。

我們提供:

  • NVMe 容量與讀取效能規劃
  • 單台 expert streaming 或雙台完整常駐的取捨
  • vLLM/SGLang 部署與參數調校
  • 資料不出機房的網路與權限設計

資料不能出機房,又想用最強的模型?

把你的資料類型、context 長度與同時使用人數告訴我們,先評估地端跑不跑得動。

預約地端大模型評估 免費預約諮詢

電話:02-2717-1019 LINE:@zonetech

關於作者

黃俊凱 Gask Hung|蓋斯克科技創辦人,曾任 D-Link 網路研發工程師、QNAP 雲端儲存應用工程師/專案經理,近期投入地端 LLM 導入評估。完整作者介紹

延伸閱讀:買一台還是兩台?DGX Spark 1x vs 2x 效能對決DGX Spark 最佳模型推薦:1x / 2x / 4x 配置清單DGX Spark 雙機怎麼接?ConnectX-7 200G 網路設定資安研究員的 DGX Spark 使用指南

更多關於510GB 模型塞進 128GB:DGX Spark 跑 DeepSeek V4.1 Flash 的完整方法的常見問題FAQ

跑 DeepSeek V4.1 Flash 需要什麼硬體配置?

單台 DGX Spark(128GB)+ 本機 NVMe SSD(4TB 以上建議)可以跑,但速度受限。兩台 DGX Spark(256GB)才能讓 expert 完全常駐、達到最快速度。

NVMe streaming 速度夠快嗎?

DGX Spark 內建 4TB NVMe,expert 按需從 SSD 載入。實測 15–21 tok/s 的速度可以做開發測試,但比起雲端 API 的 80–120 tok/s 還是有差距。

未來會更快嗎?

有很大機會。單台版本在同一天內就從 15.2 tok/s 優化到 20.85 tok/s,DSpark 投機解碼、更好的 expert prefetching、TensorRT-LLM 官方支援都在開發中。NVIDIA Developer Forum 上也持續有新的設定分享。

品質有因為 quantization 下降嗎?

用的是 MXFP4 quantization,這是 NVIDIA Blackwell 架構原生支援的格式,實際品質差異建議用你自己的任務測試。

資料來源

GitHub 0xBakeer/deepseek-v41-flash-spark、GitHub tonyd2wild/DeepSeek-V4.1-Flash-vLLM-DGX-Spark、GitHub MiaAI-Lab/DeepSeek-v4.1-Flash-DGX-Sparks、NVIDIA Developer Forums(DeepSeek v4.1 Flash 討論串)、X @0xBakeer、X @0x0SojalSec。

蓋斯克科技

企業級網路規劃
電話:02-27171019
商家:https://g.page/zonetech-tw
地址:10491臺北市中山區建國北路二段125號4樓

分享至Facebook

精選文章

📍 服務地區

台北辦公室網路規劃 新北企業資訊委外 台北IT委外服務 新北網路建置規劃 台北設備租賃 新北設備租賃