DeepSeek V4.1 Flash 是 510GB 的 MoE 模型,你的 DGX Spark 只有 128GB。按照直覺這不可能跑,但社群在 2026 年 9 月用 expert streaming 技術把它跑起來了,單台速度在同一天內從 15.2 tok/s 優化到 20.85 tok/s。這篇解釋技術原理,以及你需要什麼配置才能跑起來。
這篇要說清楚三件事:expert streaming 怎麼運作、單台 vs 多台跑 DeepSeek V4.1 Flash 的效能差距有多大、你現在就可以試的 GitHub repo 在哪裡。

這篇適合誰看
- 已有 DGX Spark,想在上面跑最強的開源模型
- 聽過 DeepSeek V4.1 Flash 但不知道怎麼在 128GB 機器上跑
- 評估是否需要加購第二台來跑完整版
- 對 MoE expert routing 技術有興趣的工程師
510GB 塞進 128GB:Expert Streaming 原理

DeepSeek V4.1 Flash 是 MoE(Mixture of Experts)架構,理論上有 384 個 expert,但每個 token 只激活其中 6 個。這意味著你不需要把所有 384 個 expert 都放進 RAM,只需要常駐最常用的 expert,其他的按需從 NVMe SSD 串流讀入。
用戶 0xBakeer 在 GitHub 開源的 deepseek-v41-flash-spark 專案,實作了「resident hot experts + NVMe streaming」架構:讓模型告訴你什麼工作需要哪些 expert,只常駐那些 expert(約佔 25.6% expert set),其餘從 NVMe 按需載入。2026 年 9 月 11 日當天從 15.2 tok/s 優化到 20.85 tok/s,9 月 14 日作者展示了單台開 256K context 的版本。資料來源:GitHub 0xBakeer/deepseek-v41-flash-spark、X @0xBakeer。
三種配置的實際效能數字

| 配置 | 方式 | Token 生成速度 | Context | 備註 |
|---|---|---|---|---|
| 1x DGX Spark | NVMe expert streaming(25.6% 常駐) | 15.2–20.85 tok/s | 32,768–256K(依設定) | 速度持續優化中 |
| 2x DGX Spark(TP=2) | 全 expert 常駐 | 32 tok/s 單串 / 42 tok/s 並發 | 600,000 | 600k KV cache 可用 |
| 4x DGX Spark(TP=4) | vLLM TP4 全速 | 84.9 tok/s(數學)/ 65.3 tok/s(程式碼) | 1M+ | 需 400G 交換機 |
現在就可以開始的方式

如果你有單台 DGX Spark,最快的起始方式是用 0xBakeer 的 repo:
git clone https://github.com/0xBakeer/deepseek-v41-flash-spark
cd deepseek-v41-flash-spark
# 依照 README 設定 expert 常駐比例
# 建議從 MAX_SEQ=32768、25.6% resident 開始
關鍵設定項目是 resident expert 比例和 MAX_SEQ。resident 比例越高,RAM 佔用越多但速度越快;MAX_SEQ 越大,context window 越長但記憶體剩給 expert 越少。
結論
510GB 模型在 128GB 機器上跑得起來,而且速度仍在快速優化。單台已可用於開發和實驗,兩台才是完整體驗 DeepSeek V4.1 Flash 的配置(一台與兩台的差別)。如果你的應用需要 frontier-level 模型推論且資料不能出機房,這是目前最可行的本機方案。
立即開始:在自己的機房跑 frontier 模型
蓋斯克科技協助企業在地端跑大型 MoE 模型,從硬體、儲存到推論框架一起規劃。
我們提供:
- NVMe 容量與讀取效能規劃
- 單台 expert streaming 或雙台完整常駐的取捨
- vLLM/SGLang 部署與參數調校
- 資料不出機房的網路與權限設計
資料不能出機房,又想用最強的模型?
把你的資料類型、context 長度與同時使用人數告訴我們,先評估地端跑不跑得動。
預約地端大模型評估 免費預約諮詢電話:02-2717-1019 LINE:@zonetech
關於作者
黃俊凱 Gask Hung|蓋斯克科技創辦人,曾任 D-Link 網路研發工程師、QNAP 雲端儲存應用工程師/專案經理,近期投入地端 LLM 導入評估。完整作者介紹
延伸閱讀:買一台還是兩台?DGX Spark 1x vs 2x 效能對決|DGX Spark 最佳模型推薦:1x / 2x / 4x 配置清單|DGX Spark 雙機怎麼接?ConnectX-7 200G 網路設定|資安研究員的 DGX Spark 使用指南
更多關於510GB 模型塞進 128GB:DGX Spark 跑 DeepSeek V4.1 Flash 的完整方法的常見問題FAQ
跑 DeepSeek V4.1 Flash 需要什麼硬體配置?
單台 DGX Spark(128GB)+ 本機 NVMe SSD(4TB 以上建議)可以跑,但速度受限。兩台 DGX Spark(256GB)才能讓 expert 完全常駐、達到最快速度。
NVMe streaming 速度夠快嗎?
DGX Spark 內建 4TB NVMe,expert 按需從 SSD 載入。實測 15–21 tok/s 的速度可以做開發測試,但比起雲端 API 的 80–120 tok/s 還是有差距。
未來會更快嗎?
有很大機會。單台版本在同一天內就從 15.2 tok/s 優化到 20.85 tok/s,DSpark 投機解碼、更好的 expert prefetching、TensorRT-LLM 官方支援都在開發中。NVIDIA Developer Forum 上也持續有新的設定分享。
品質有因為 quantization 下降嗎?
用的是 MXFP4 quantization,這是 NVIDIA Blackwell 架構原生支援的格式,實際品質差異建議用你自己的任務測試。
資料來源
GitHub 0xBakeer/deepseek-v41-flash-spark、GitHub tonyd2wild/DeepSeek-V4.1-Flash-vLLM-DGX-Spark、GitHub MiaAI-Lab/DeepSeek-v4.1-Flash-DGX-Sparks、NVIDIA Developer Forums(DeepSeek v4.1 Flash 討論串)、X @0xBakeer、X @0x0SojalSec。





