資訊設備大小事

DGX Spark 並發效能被嚴重低估:256 並行連線下的真實 120x 吞吐量

2026-09-16
多台筆電經網路線連到同一台 AI 主機|蓋斯克科技
所有 DGX Spark 評測都在測單串 token 生成速度,但這台機器的設計重點是並發吞吐量。在 256 並行連線下,DGX Spark 的實際吞吐量比單串評測高 120 倍。解釋算力 vs 記憶體頻寬的差別,以及什麼工作負載才能讓 1 petaFLOP 的算力有意義。

所有 DGX Spark 的單串效能評測都漏了同一件事:這台機器跑單一對話的速度不算快,但一旦你把並行連線數拉到 256,吞吐量比單串測試高出 120 倍。大多數評測文章給你的數字是用來刷社群媒體的,不是你在生產環境應該在乎的指標。

這篇解釋 DGX Spark 的算力設計邏輯、並發場景的真實效能,以及什麼工作負載才能讓 1 petaFLOP 的算力有意義。

辦公室機櫃中的共用 AI 推論主機|蓋斯克科技

這篇適合誰看

  • 企業在評估 DGX Spark 作為內部 AI API 伺服器
  • 開發者在設計多 agent 系統,需要了解並發上限
  • 看到單串評測數字後覺得「這不快啊」的人
  • 想了解 DGX Spark 的 1 petaFLOP 在什麼情境下才會展現

為什麼單串評測無法代表 DGX Spark 真實效能

連續批次處理提升吞吐量架構圖|蓋斯克科技

LLM 推論有兩個不同的效能指標:

  • Token 生成速度(decode):記憶體頻寬決定,DGX Spark 273 GB/s,這裡不是優勢
  • 吞吐量(throughput):1 petaFLOP FP4 算力展現,多請求並行批次處理,這是 DGX Spark 的設計重點

大多數評測只測第一個,因為這個指標容易測、數字直覺、好寫文章。但第二個才是企業部署時真正關心的。

Dendro Logic 的 DGX Spark 並發 benchmark 顯示:在 concurrency 256(256 個同時進行的推論請求)下,總吞吐量(tokens/second)比單串測試高出 120 倍。原因是推論框架的 continuous batching 可以把 256 個請求的計算合併成一個大批次,讓 1 petaFLOP 的算力完全發揮。資料來源:Dendro Logic NVIDIA DGX Spark Concurrency Benchmark。

算力 vs 頻寬:哪個是你的瓶頸

單人與多人並發情境瓶頸比較圖|蓋斯克科技
場景決定因素DGX Spark 表現Mac Studio 表現
單個對話(低並發)記憶體頻寬中等(273 GB/s)優秀(M3 Ultra 為 819 GB/s)
多 agent 並發(10–50 請求)算力 + 頻寬混合良好受頻寬限制
高並發 API 服務(100+ 請求)算力(1 petaFLOP)優秀中等
長 prompt prefill算力優秀中等

Prefill 場景:DGX Spark 的另一個優勢

適合 DGX Spark 的三種高並發工作負載圖|蓋斯克科技

Prefill 是把輸入的 prompt 全部處理成 KV cache 的階段,這是計算密集的,算力決定速度。當你的應用有長 system prompt、大量 context、文件分析時,DGX Spark 的 prefill 速度明顯快過 Mac Studio。

企業部署怎麼評估

如果你要用 DGX Spark 作為企業內部的 AI API 伺服器,公開評測的並發數字只能當參考,實際容量取決於模型大小和 prompt 長度:

  • 先用自己的工作負載壓測:用實際的 prompt 長度和同時連線數跑一次,看總吞吐量和單一請求延遲(機型怎麼挑見 地端 LLM 主機大車拼
  • 1 台先給小團隊試用:確認模型品質和延遲可以接受
  • 要更大模型或更多人同時用再擴充:2 台、4 台用 tensor parallel 分攤

結論

如果你的應用是單個用戶的私人 AI 助手,Mac Studio 或雲端 API 在速度體驗上更好。如果你在建 multi-agent 系統、企業內部 API 服務、或需要高並發的 RAG 管道,DGX Spark 1 petaFLOP 的算力在這裡才能充分發揮。選擇硬體之前,先確認你的工作負載是「單串」還是「並發」,再做決定。

立即開始:用你自己的工作負載做決定

蓋斯克科技協助企業用實際工作負載評估地端 AI 主機,不用規格表決定採購。

我們提供:

  • 依併發人數與 prompt 長度估算需求
  • 推論框架選擇與併發參數調校
  • 多台擴充的時機與方式
  • 企業內部 API 服務的網路與權限設計

不知道機器撐不撐得住團隊一起用?

把你的使用人數、常用模型與尖峰時段告訴我們,先幫你判斷該買幾台。

預約併發需求評估 免費預約諮詢

電話:02-2717-1019 LINE:@zonetech

關於作者

黃俊凱 Gask Hung|蓋斯克科技創辦人,曾任 D-Link 網路研發工程師、QNAP 雲端儲存應用工程師/專案經理,近期投入地端 LLM 導入評估。完整作者介紹

延伸閱讀:買一台還是兩台?DGX Spark 1x vs 2x 效能對決DGX Spark 最佳模型推薦:1x / 2x / 4x 配置清單DGX Spark 雙機怎麼接?ConnectX-7 200G 網路設定地端 LLM 主機大車拼:DGX Spark vs Mac vs RTX 5090

更多關於DGX Spark 並發效能被嚴重低估:256 並行連線下的真實 120x 吞吐量的常見問題FAQ

DGX Spark 可以作為公司內部 API 伺服器嗎?

可以。TensorRT-LLM 支援 OpenAI 相容的 API 介面,部署後公司內部系統可以直接呼叫,不需要修改現有的 API 呼叫代碼,只需要把 endpoint 改成本機 IP。

並發 256 對應的現實使用者數量是多少?

沒辦法直接換算成人數,要看平均 prompt 長度、回答長度和大家同時送出的比例。建議用內部實際使用紀錄估出尖峰同時連線數,再拿這個數字壓測。

vLLM 和 TensorRT-LLM 在 DGX Spark 上哪個比較推薦?

TensorRT-LLM 是 NVIDIA 官方優化的方案,在 DGX Spark 上有最好的效能(包含 DGX OS 的深度整合),適合追求最大吞吐量。vLLM 相容性更廣、社群支援更多,適合需要快速部署且不想花時間調 TensorRT。兩個都可以,優先試 TensorRT-LLM。

資料來源

Dendro Logic NVIDIA DGX Spark Concurrency Benchmark(120x throughput at concurrency 256)、Reddit r/LocalLLM 串 1w93ap4(M5 Ultra vs 2x DGX Spark benchmark)、IntuitionLabs NVIDIA DGX Spark Review、Tom’s Hardware NVIDIA DGX Spark Review。

蓋斯克科技

企業級網路規劃
電話:02-27171019
商家:https://g.page/zonetech-tw
地址:10491臺北市中山區建國北路二段125號4樓

分享至Facebook

精選文章

📍 服務地區

台北辦公室網路規劃 新北企業資訊委外 台北IT委外服務 新北網路建置規劃 台北設備租賃 新北設備租賃