資訊設備大小事

地端 LLM 主機大車拼:DGX Spark 實測 vs Mac M5 Max vs AMD Strix Halo vs RTX 5090 自組(2026)

2026-09-17

發布:2026-09-14|最後更新:2026-09-14

「128GB 統一記憶體」這幾個字,在 2026 年變成了地端 AI 主機最容易讓人誤判的規格。看到 DGX Spark、華碩 Ascent GX10、或 Mac Studio 標出 128GB,很直覺會想成「比 96GB 顯卡還大,應該更強」。

但容量跟頻寬是兩個完全不同的問題:128GB 統一記憶體讓大模型「塞得進去」,記憶體頻寬才決定「跑得多快」。DGX Spark 的 128GB 只有 273 GB/s 頻寬,而一張 96GB 的 RTX PRO 6000 Blackwell 卻有 1,792 GB/s——頻寬差了超過 6 倍。這篇把 DGX Spark、Ascent GX10、Mac Studio M5 Max、AMD Strix Halo、RTX 5090 自組五台機器攤開比較,講清楚「照你的瓶頸買,不是照盒子上最大的數字買」到底怎麼判斷。

📋 本文重點摘要

  • 關鍵判斷:容量決定「塞不塞得下模型」,頻寬決定「跑得多快」,兩者常常互相矛盾,要照你的實際瓶頸買
  • 五台選手:DGX Spark(128GB/273GB/s)、Ascent GX10(同架構)、Mac Studio M5 Max(128GB/614GB/s)、AMD Strix Halo(128GB/頻寬更受限)、RTX 5090 自組(僅 32GB/但 1,792GB/s)
  • 情境對決:單人開發偏向大容量機種;5-20 人共用生產環境更看重頻寬與併發吞吐
  • 蓋斯克現況:已導入 DGX Spark 實機進行地端部署評估與測試,正式效能實測數據將於後續文章更新

👤 適合閱讀對象

  • 評估地端 LLM 主機的 IT 主管/MIS:看了規格表卻不知道「128GB 統一記憶體」跟「96GB 顯卡」該怎麼選,怕買錯又要重買一次。
  • 要幫團隊配置私有推理環境的工程主管:需要一台能讓 5-20 人同時開發、跑 agent 的機器,在乎的是併發表現,不是單機跑分。
  • 預算有限、想先小規模試水溫的中小企業主:想知道 Strix Halo 這種便宜方案跟 DGX Spark 這類機種實際差在哪,值不值得多花錢。

不確定公司該買哪一級地端 LLM 主機?加 LINE 傳你的使用情境(人數、常用模型、預算),我們先幫你初步判斷方向 → 加 LINE 諮詢

一、比什麼才公平:prefill 與 decode 的認知陷阱

比較地端 LLM 主機最常見的錯誤,是只看一個數字就下結論——不是記憶體容量,就是官方標的理論算力。照盒子上最大的數字買,買回來才發現不符合自己的使用情境,是這類採購最常見的踩雷模式。

要看懂這些機器的實際表現,得先分清楚推論的兩個階段:

  • Prefill(前處理):模型讀入你輸入的整段 prompt、建立內部狀態的階段。輸入越長(例如貼一份完整文件),這個階段耗時越長,吃的是「算力+頻寬」的組合。
  • Decode(生成):模型逐字吐出回答的階段,每產生一個字都要把整個模型的權重從記憶體搬進運算單元一次。這個階段幾乎完全被記憶體頻寬卡住。

一個好懂的比喻:容量像倉庫大小,頻寬像出貨口的輸送帶速度。倉庫(128GB 統一記憶體)夠大,代表貨(大模型)塞得進去;但輸送帶(記憶體頻寬)不夠快,貨還是得慢慢一件一件搬出來。社群實測就看得到這個落差:AMD Strix Halo 的逐字生成速度(約 73 tokens/s)跟 DGX Spark(約 84 tokens/s)其實相近,但處理長輸入的 prompt processing 速度慢了超過 6 倍(342 對 2,107 tokens/s)——輸送帶速度的差距,在長文件輸入的場景一下就現形。

所以「這台機器適不適合我」的正確問法,不是「規格表上哪一台數字最大」,而是「我的實際使用情境,瓶頸會卡在 prefill 還是 decode」。下一節的五台選手規格表,會把容量與頻寬並列,方便對照。

Prefill與Decode兩階段瓶頸不一樣:倉庫與輸送帶比喻|蓋斯克科技
Prefill與Decode兩階段的瓶頸不同:容量像倉庫,頻寬像輸送帶

二、五台選手規格表:容量與頻寬並列(2026-08 台幣市價)

五台機器分成兩派:DGX Spark/Ascent GX10/Mac Studio M5 Max 走「大容量統一記憶體」路線,RTX 5090 自組走「小容量高頻寬」路線,AMD Strix Halo 則是容量夠但頻寬最保守的入門選項。下表把公開規格與台灣市價一次列出,價格會隨通路與時間波動,下單前務必再核實current報價。

機種記憶體容量記憶體頻寬台幣市價(2026-09 更新)備註
NVIDIA DGX Spark128GB LPDDR5X 統一記憶體273 GB/s4TB 版約 NT$199,000(2026-09 電商報價,區間約 NT$187,000–214,900,依通路與容量)GB10 Grace Blackwell 超級晶片、1 PFLOP(FP4)、1.1 公升、38W 推理功耗,官方雙機互連最高 256GB
華碩 Ascent GX10128GB 統一記憶體273 GB/s(同 GB10 架構)NT$171,900 起(依容量,2026-09 電商報價;官方建議價 NT$97,900 起)與 DGX Spark 同一顆 GB10 晶片,現行市價已明顯高於官方建議價
Mac Studio M5 Max最高 128GB 統一記憶體614 GB/s基礎款 NT$84,900 起,128GB 版本為加購選配,確切升級價 [需確認]頻寬介於 Spark 與 RTX 5090 之間,Apple 生態系軟體支援度是額外考量
AMD Strix Halo(128GB)128GB LPDDR5X 統一記憶體官方理論值 256 GB/s,實測約 215 GB/s(混合 CPU/GPU 負載下)約 US$2,000(約 NT$62,000,估算,依匯率與通路調整)token 生成速度(約 73 t/s)與 Spark(約 84 t/s)接近,但長輸入 prompt processing 明顯較慢(約 342 對 2,107 tokens/s)
RTX 5090 自組(32GB)32GB GDDR71,792 GB/s顯卡本身約 NT$159,900–180,000+(2026 因記憶體成本上漲,市價已大幅高於官方建議售價,仍需另加主機其餘組件)頻寬是五台裡最高,但容量僅 32GB,塞不下未經量化的大型模型,需搭配量化或多卡

容量與頻寬的落差在表裡一目了然:DGX Spark、Ascent GX10、Mac Studio 三台都能把大模型完整放進記憶體,但頻寬只有 RTX 5090 的六分之一到十五分之一;RTX 5090 頻寬遙遙領先,卻連一個未量化的 70B 模型都放不下。沒有哪一台是全面獲勝,端看你的模型規模與使用情境落在哪一邊。

地端LLM主機記憶體容量與頻寬定位圖:DGX Spark、Ascent GX10、Mac Studio M5 Max、AMD Strix Halo、RTX 5090比較|蓋斯克科技
五台地端LLM主機的記憶體容量與頻寬定位比較(頻寬取官方理論值,實際表現依模型與軟體版本而異)

三、蓋斯克 DGX Spark 實測進度

蓋斯克科技目前已導入 DGX Spark 實機,進行地端部署評估與測試,正式的效能實測與壓測作業仍在進行中。為了避免在數據還沒跑完前就誤導讀者的採購判斷,本篇暫不刊出任何具體的 tokens/s、載入時間或功耗數字——這些獨家實測數據,會在後續文章(DGX Spark 台灣開箱實測、地端 LLM 建置完整指南)數據到位後補上,並回頭更新本篇。

在正式數據公布之前,下一節先整理社群端已公開、可查證來源的實測數據,作為初步參考。

四、其他平台數據:社群實測

以下數字全部來自社群公開實測,不是官方跑分,也不是蓋斯克自己的測試結果——僅供初步參考,實際表現會因模型版本、量化格式與軟體版本而有落差。

平台測試內容結果
DGX Spark(單台)Qwen3.6-35B-A3B(NVFP4 量化,256K context)約 110 tokens/s(社群實測)
DGX Spark(雙台叢集)DeepSeek V4-Flash(284B,1M context)約 40–45 tokens/s(社群實測,官方僅支援 2 台原生互連)
DGX Spark(單台,vLLM 服務)64 位使用者同時併發700+ tokens/s 總吞吐、約 38W 功耗(社群實測)
AMD Strix Halo(128GB)token 生成速度約 73 tokens/s,與 DGX Spark(約 84 tokens/s)相近
AMD Strix Halo(128GB)Prompt processing(長輸入處理)約 342 tokens/s,明顯低於 DGX Spark 的約 2,107 tokens/s(約 6 倍差距)

這批數字剛好對照出第一節講的 prefill/decode 落差:token 生成速度(decode)Strix Halo 與 DGX Spark 接近,但長輸入的 prompt processing(prefill)差了 6 倍——跟第一節「頻寬決定輸送帶速度」的說法完全吻合。至於 Mac Studio M5 Max 與 RTX 5090 自組在地端 LLM 場景下的社群標準化實測數據,目前尚未有足夠樣本可以引用,本篇暫不列出,避免用零星、不具代表性的單一貼文數字誤導判斷。

想知道你的環境適不適合導入 AI?

LINE 傳訊描述你的設備規模,免費給你初步可行性評估,不用先約不用先付錢。

LINE 詢問 AI 導入 → 預約免費健診

五、情境對決:單人開發/5-20 人共用/高併發生產,各誰贏

同一台機器在不同情境下的評價可能完全相反——這也是為什麼「哪台最好」是個沒有單一答案的問題。下表按三種常見使用情境拆解:

情境關鍵需求較適合的方向理由
單人開發/agent 實驗能把大模型完整載入、方便反覆實驗DGX Spark/Ascent GX10/Mac Studio 128GB單人使用時延遲不是最痛的瓶頸,能跑更大、更完整的模型比速度更重要
5-20 人團隊共用多人同時發出請求時的併發吞吐與延遲穩定度視預算:頻寬與併發架構(如多卡)比單純容量更關鍵社群實測顯示 DGX Spark 單台 vLLM 服務 64 併發可達 700+ tokens/s 總吞吐,但正式導入前建議先用實際工作負載壓測
高併發生產環境/對外服務穩定低延遲、高吞吐、可橫向擴充高頻寬獨立 VRAM 顯卡(如 RTX 5090 等級或以上)為主流做法,必要時走多卡或伺服器級方案生產環境的吞吐需求通常已經超出單一統一記憶體平台的設計定位,這類機種較適合開發與驗證階段,而非大規模生產

換句話說,DGX Spark 這類統一記憶體機種的甜蜜點,是「能把原本跑不動的大模型跑起來」的開發與驗證階段;一旦要撐起正式對外服務的併發量,傳統高頻寬顯卡架構仍然是更成熟的選擇。

情境對決:單人開發、團隊共用、高併發生產各適合什麼機種|蓋斯克科技
三種使用情境對決:單人開發、5-20人團隊共用、高併發生產

六、記憶體頻寬 273GB/s 爭議:這個數字到底該怎麼看

DGX Spark 發表以來,273 GB/s 的記憶體頻寬一直是社群爭論最激烈的規格點——有人認為這是致命缺陷,也有人認為這個爭論本身就搞錯了重點。把正反兩面的論點攤開來看:

頻寬 ÷ 模型大小:一條公式算出理論上限

推論每生成一個字,理論上要把模型全部權重從記憶體讀一遍,所以生成速度的理論上限,就是「記憶體頻寬 ÷ 模型檔案大小」。這條公式能幫你在買機器前,自己粗估任何一張卡跑任何模型的速度天花板,不必等別人幫你測。

知乎用戶「大兵」在 2026 年 8 月的實測文章裡給出了具體案例:一台 DGX Spark 跑 Qwen3.8-27B 的 Q8 量化版(權重約 29GB),實測生成速度 6.8 token/s。代入公式:273 GB/s ÷ 29 GB ≈ 9.4 token/s 理論上限,實測是理論值的約 73%——這個比例對 GGUF 推理來說算正常水位,代表卡住速度的不是引擎調度出問題,是頻寬這道物理限制本身。(原文連結

更反直覺的是,同一台機器跑 7B 小模型(權重約 4.7GB)表現反而更差:理論上限 58 token/s,實測只有 14.8,利用率僅 25%。模型越小,頻寬瓶頸越不明顯,反而被 KV cache 讀寫與調度開銷稀釋得更嚴重。換句話說,這類大容量低頻寬機種是為大模型設計的,拿來跑小模型不見得划算。

社群怎麼吵:DGX Spark 到底值不值

上面那篇實測的結論一發布,留言區立刻出現反駁,而且雙方都拿得出數字。這場爭論本身,比單一測試結果更能看出這台機器的真實定位——關鍵是「有沒有做優化」與「單機還是叢集」。

立場論點數字
原文實測29GB 模型只跑得動 6.8 token/s,浪漫和現實在規格書裡已經分好工6.8 t/s(未優化)
留言反駁(kuriAsk)開 NVFP4 量化+投機解碼,代碼任務實測可到「勉強夠用」的水準40+ t/s
留言反駁(奶牛男孩400g)用兩台 Spark 部署 DeepSeek Flash,四路並發下單路表現不差,單機測試不代表叢集表現約 60 t/s/路
留言質疑(FisherPri C)同樣的錢拿去訂 Kimi K3+GLM 5.3 API,可以高低搭配用 2-3 年成本對比,非速度
對照組(海狸)一張舊的 RTX 3090 配 MTP 投機解碼+TurboQuant,純推理反而更快65+ t/s

原文作者事後也做了一次自我修正,值得留意:他原本告訴朋友「Q5 量化感知不到損失」,被追問依據時才發現,那其實是社群在別的模型上測出的通用經驗,Qwen3.8-27B 本身的 Q5 對 Q8 損失,當時沒有人公開實測過。這提醒一件事:本地部署社群流傳的「經驗法則」,不一定對應到你正在用的那個模型版本,遇到新模型時最好自己驗證,不要照搬別人在舊模型上的結論。

多篇實測也指向同一個結論:架構比參數規模更決定本地速度。Qwen3.6-35B-A3B 是 MoE 架構、名義 35B 但每個 token 只激活約 3B,實測反而比參數量較小的 Qwen3.8-27B 稠密模型跑得快,速度可以從個位數拉到 40 token/s 以上。選機器的同時,模型架構要一起考慮,不是只看參數量。

認為 273GB/s 是硬傷的論點

一張專業工作站顯卡,例如 RTX PRO 6000 Blackwell,記憶體頻寬高達 1,792 GB/s,是 DGX Spark 的 6 倍以上。decode(逐字生成)階段幾乎完全被頻寬卡住,代表同樣的模型在 DGX Spark 上生成速度可能明顯慢於高頻寬顯卡——即使 DGX Spark 的記憶體容量看起來更大。128GB 這個數字,很容易讓人誤以為「規格更強」,但實際使用體驗未必對應到規格表上的容量數字。

認為這個爭論搞錯重點的論點

統一記憶體架構真正的價值,不在於頻寬本身,而在於 CPU 與 GPU 共用同一個大型記憶體池,不再是傳統「系統 RAM 給 CPU、VRAM 給 GPU」的兩套獨立資源。這讓一顆 24GB、32GB 甚至 48GB 的傳統顯卡完全裝不下的模型,在統一記憶體架構上變得「可以先跑起來」。對開發、agent 實驗、私有推理這類場景,機器不需要贏過一張萬元顯卡的跑分,只需要讓工作變得可行、方便、成本合理——這是跟傳統跑分指標不同的效能定義。

用儲存設備類比會更好懂:擁有 20TB 硬碟不代表電腦比裝 2TB SSD 的電腦更快,你只是有更多空間,不代表有更高的吞吐量。AI 記憶體也是類似邏輯——容量決定能放進什麼,頻寬決定運算能多快取用它,依工作負載不同,任何一項都可能是瓶頸。

蓋斯克的判斷是:這不是「VRAM 已死」的故事,而是「VRAM 不再是唯一的記憶體思考方式」。過去的心智模型是「GPU → VRAM → 模型」,現在的心智模型更接近「CPU + GPU + 統一記憶體 + 高速互連 + 軟體」一起決定實際表現。2026 年之後,比較地端 AI 主機該問的問題,不會是「哪張顯卡 VRAM 最大」,而是「哪一種記憶體架構最適合我實際在跑的工作負載」。

七、結論選購矩陣:預算×人數×用途該挑哪一台

地端 LLM 主機選購矩陣結論字卡|蓋斯克科技

沒有一台機器是全能冠軍,選購邏輯應該從「你的預算、團隊人數與主要用途」三個維度交叉判斷,而不是單看某一項規格。

你的情境建議方向
預算有限、想先驗證地端 LLM 可行性AMD Strix Halo 或先用現有顯卡依規格對照表評估是否夠用,避免一次到位就買最貴的機種
單人或小團隊,要跑 30B-70B 級模型做開發/agent 實驗DGX Spark 或 Ascent GX10,128GB 統一記憶體能把大模型完整載入,開發階段的容量優先於極限速度
已在 Apple 生態系、重視軟體整合與日常泛用性Mac Studio M5 Max 128GB,頻寬介於 Spark 與 RTX 5090 之間,是相對均衡的選擇
5-20 人團隊要共用生產環境,需要穩定吞吐需要實際用你的工作負載壓測,通常會走向多卡或高頻寬架構,而非單一統一記憶體主機
不確定要不要一次買斷,想先小規模試用可評估設備租賃方案,用實際使用狀況決定要不要轉為採購

如果你還在猶豫採購還是租賃,可以參考蓋斯克的地端 LLM 建置完整指南——裡面整理了地端 vs 雲端 API vs 雲端託管三條路線的完整成本試算,能幫你先確認「地端」這條路線本身划不划算,再回頭挑機種。

地端LLM主機結論選購矩陣:五種情境對照建議方向|蓋斯克科技
地端LLM主機結論選購矩陣

結論

三個帶走的重點:(1)容量決定塞不塞得下模型,頻寬決定跑得多快,兩者常常互相矛盾;(2)DGX Spark、Ascent GX10、Mac Studio 三台走大容量路線,適合開發與驗證;RTX 5090 走高頻寬路線,適合已經確定模型規模、要衝吞吐的場景;(3)沒有標準答案,先確認自己的瓶頸在 prefill 還是 decode,再對照規格表選機種。蓋斯克科技的 DGX Spark 實機評測仍在進行中,正式數據到位後會回頭更新本篇,也會發布獨立的開箱實測文章。

地端LLM主機選購三個重點:容量頻寬取捨、五台定位、prefill decode判斷|蓋斯克科技
地端LLM主機大車拼三個帶走的重點

立即開始:你的地端 LLM 主機值得一次選對

蓋斯克科技協助台灣中小企業評估地端 AI 基礎建設,從單機開發環境到多人共用的生產架構,依實際使用情境給建議,而不是先推銷特定機種。

我們提供:

  • 依你的團隊規模與主要用途,判斷該優先看容量還是頻寬
  • 2026 年最新市場報價區間,避免用過時規格或價格做決策
  • 透明報價,無隱藏費用
  • 設備租賃與採購兩種路線並陳,讓你先試用再決定

不確定地端 LLM 主機該租還是該買?

蓋斯克科技提供企業設備租賃與地端 AI 導入評估服務,先幫你確認需求規模,再決定要不要投資硬體。

了解設備租賃方案 免費預約諮詢

電話:02-2717-1019 LINE:@zonetech

關於作者

Gask Hung|蓋斯克科技創辦人,專注台灣中小企業 IT:企業 Wi-Fi、4K 剪輯系統、IT 委外與設備租賃,近期投入地端 LLM 導入評估。完整作者介紹

延伸閱讀:地端 LLM 建置完整指南LLM 主機規格怎麼抓?VRAM 對照表買一台還是兩台?DGX Spark 1x vs 2xDGX Spark 雙機怎麼接?200G 網路設定DGX Spark 台灣購買指南設備租賃服務

更多關於地端 LLM 主機選購的常見問題FAQ

Q1:DGX Spark 一定比較好嗎?買 RTX 5090 自組不行嗎?

不一定。DGX Spark 適合要把大模型完整載入、做開發驗證的情境;RTX 5090 頻寬高但容量只有 32GB,適合模型規模已確定、需要高吞吐的情境。要看你的實際工作負載,不是規格數字越大越好。

Q2:128GB 統一記憶體跟 128GB VRAM 顯卡一樣嗎?

不一樣。目前市面上沒有單卡 128GB VRAM 的消費級/專業級顯卡;統一記憶體是 CPU 與 GPU 共用同一記憶體池,容量雖大但頻寬通常明顯低於高階獨立顯卡的 VRAM,兩者不能直接畫等號。

Q3:記憶體頻寬 273GB/s 算慢嗎?

跟專業級顯卡(如 1,792 GB/s)比確實明顯較低,但跟同級的統一記憶體平台(如 AMD Strix Halo)相比並不算特別差。是否「夠用」要看你的模型規模與併發需求,而非單獨看這個數字。

Q4:五台裡面哪一台最便宜?

以社群估算的 AMD Strix Halo 128GB 方案价格最低,約 NT$62,000 上下(估算值,依匯率與通路調整);但要注意它的長輸入處理速度明顯較慢,便宜有對應的取捨。

Q5:5-20 人團隊共用,一定要買貴的機器嗎?

不一定要買最貴的,但要先用實際工作負載壓測,而不是只看規格表。社群實測顯示單台 DGX Spark 用 vLLM 服務 64 併發可以有 700+ tokens/s 總吞吐,但正式導入前建議先驗證自己的模型與使用模式。

Q6:蓋斯克自己測過這些機器嗎?

蓋斯克目前已導入 DGX Spark 實機進行評估測試,正式效能實測數據仍在進行中,本篇暫不引用任何自測 tokens/s 數字,待數據到位後會更新本篇並發布獨立實測文章。

Q7:要買斷還是用租的比較好?

如果還不確定長期使用規模,可以先評估設備租賃方案,用實際使用狀況判斷要不要轉為採購,避免規格選錯又要重新投資。

Q8:Mac Studio 跑地端 LLM 划算嗎?

如果你本來就在 Apple 生態系、重視軟體整合與日常泛用性,Mac Studio M5 Max 128GB 的頻寬(614GB/s)介於 DGX Spark 與 RTX 5090 之間,是相對均衡的選擇;但 128GB 版本的確切加購價格需另外向 Apple 官網確認。



蓋斯克科技

企業級網路規劃
電話:02-27171019
商家:https://g.page/zonetech-tw
地址:10491臺北市中山區建國北路二段125號4樓

分享至Facebook

精選文章

📍 服務地區

台北辦公室網路規劃 新北企業資訊委外 台北IT委外服務 新北網路建置規劃 台北設備租賃 新北設備租賃