資訊設備大小事

Mac Studio M5 Max/M5 Ultra 跑地端 LLM 實測整理:聊天夠快,跑 Agent 為什麼還是慢?

2026-09-17
Mac Studio 辦公室桌面實景|地端LLM主機
Mac Studio M5 Max 與 M5 Ultra 跑本地大模型到底多快?整理官方規格、台灣售價與社群實測:decode 跟著記憶體頻寬走,prefill 靠 Neural Accelerator 翻倍,並說明跑 Agent 變慢與多人共用的限制。

作者:Gask Hung|發布:2026-09-14|最後更新:2026-09-14

在〈地端 LLM 主機大車拼〉裡,Mac Studio M5 Max 那一格我們寫的是「社群實測樣本不足,暫不列出」。新款 Mac Studio 在 2026 年 8 月 25 日發表、9 月 22 日出貨,一個月內社群已經累積一批可以對照的實測。整理下來,Mac 跑本地大模型的表現可以拆成三件事:逐字輸出的速度跟著記憶體頻寬走,M5 Max 是 614 GB/s、M5 Ultra 是 1.2 TB/s;讀入長輸入的速度靠每個 GPU 核心內建的 Neural Accelerator 大幅提升,但要軟體支援;跑 Agent 與多人共用,則是 Mac 目前最明顯的短板。Mac Studio M5 適合一個人把大模型完整跑起來;要跑 Agent,先確認 prefill 與快取設定做對;要給多人共用,還是回到獨立顯卡的架構。

📋 本文重點摘要

  • 官方規格:M5 Max 最高 128GB、614 GB/s;M5 Ultra 最高 512GB、1.2 TB/s。台灣售價分別為 NT$84,900 與 NT$199,900 起
  • decode 跟著頻寬走:同一個 27B 8bit 模型,M5 Max 約 17.8 tokens/s,頻寬較高的 M3 Ultra 約 22.8 tokens/s(社群實測)
  • prefill 才是 M5 的真正升級:同一台 M5 Max 開啟加速路徑後,gpt-oss-120b 的 prefill 從 877 提升到 1,833 tokens/s(社群實測)
  • 跑 Agent 每輪都要重讀大量輸入,快取沒命中會嚴重拖慢;多人同時使用時,Mac 的吞吐明顯落後獨立顯卡

👤 適合閱讀對象

  • 已經在用 Mac 的工程主管:想知道升級 M5 Max 128GB 或等 M5 Ultra,能不能拿來跑團隊內部的程式 Agent
  • IT/MIS:老闆看到「512GB 統一記憶體」,想買一台當全公司的 AI 主機,自己不確定該怎麼評估
  • 獨立開發者或研究人員:資料不能上雲,需要一台安靜、低功耗、能跑 100B 以上模型的桌機

想知道 Mac Studio 夠不夠你的團隊用?加 LINE 傳使用人數、常用模型和平常的上下文長度,我們先幫你判斷該看 Mac 還是獨立顯卡 → 加 LINE 諮詢

Mac Studio 辦公室桌面實景|地端LLM主機
Mac Studio 適合單機部署地端大型語言模型

一、Mac Studio M5 Max 與 M5 Ultra 規格:先看頻寬,再看容量

M5 Max 最高 128GB、614 GB/s;M5 Ultra 最高 512GB、1.2 TB/s,Ultra 的記憶體頻寬約是 Max 的兩倍,容量上限是四倍。

Mac Studio M5 Max vs M5 Ultra 規格比較|蓋斯克科技
Mac Studio M5 Max 與 M5 Ultra 規格比較:頻寬與容量

統一記憶體是 CPU 與 GPU 共用的同一池記憶體,模型權重不必在系統記憶體與顯示卡記憶體之間搬移。Mac 跑大模型的優勢來自這個架構:一台 128GB 的 Mac 可以直接載入 32GB 顯示卡塞不下的模型。載入之後跑多快,則由記憶體頻寬決定。

機種CPU/GPU最高統一記憶體記憶體頻寬台灣建議售價適用情境
Mac Studio M5 Max18 核心 CPU、最高 40 核心 GPU128GB614 GB/sNT$84,900 起(128GB 選配價 [需確認 Apple 官網])單人開發、30B 級模型、已在 Apple 生態系
Mac Studio M5 Ultra最高 36 核心 CPU、最高 80 核心 GPU(起價機型為 30 核心 CPU、64 核心 GPU、96GB)512GB(512GB 版本 10 月底出貨)1.2 TB/sNT$199,900 起單人跑 100B 以上的 MoE 模型
對照:DGX SparkGB10 超級晶片128GB273 GB/s見母文CUDA 生態、原生 FP4 運算
對照:RTX 5090 自組獨立顯卡32GB 顯存1,792 GB/s見母文模型規模已確定、要衝速度

資料來源:Apple Newsroom,2026-08-25;台灣售價依 T客邦蘋果仁報導;DGX Spark 與 RTX 5090 規格見〈地端 LLM 主機大車拼

Apple 在新聞稿裡對 M5 Ultra 的 AI 效能是這樣描述的:

M5 Ultra 的峰值 AI 運算效能最高可達 M3 Ultra 的 4.3 倍。

Apple Newsroom,2026 年 8 月 25 日,註腳標示為 Apple 於 2026 年 7 月的內部測試(原文為英文,蓋斯克翻譯)

社群文章常引用成「4.5 倍」,官方新聞稿寫的是 4.3 倍。更重要的是「峰值 AI 運算」這幾個字:它描述的是 GPU 算力,對應的是大模型推論裡讀入輸入的階段,對逐字輸出的速度幫助有限。下一節用實測數字說明這個差別。

二、M5 Max 跑大模型實際多快?社群實測整理

逐字輸出的速度幾乎跟著記憶體頻寬等比例變化;量化位元數與投機解碼,才是同一台 Mac 上能拉開一倍差距的變數。

一個好懂的比喻:大模型推論像餐廳出菜。prefill 是備料,一次把整張訂單的材料切好,靠的是廚房人手,也就是 GPU 算力;decode 是出餐,一次只能端一道菜出去,快慢取決於廚房到外場的走廊有多寬,也就是記憶體頻寬。M5 的 Neural Accelerator 等於多請了幾位切菜師傅,備料明顯變快,走廊寬度卻沒有改變。

以下數字全部來自知乎社群公開實測,Apple 官方跑分與蓋斯克自有測試都不在其中。模型版本、量化格式、推理框架不同,數字就會不同,請當成量級參考:

平台模型與設定decode(逐字輸出)prefill(讀入輸入)來源
M5 Max,40 核心 GPUQwen3.8-27B,MLX 8bit,未開投機解碼約 17.8 tokens/s未提供史蒂夫,2026-08-26
M3 Ultra,60 核心 GPU(819 GB/s)Qwen3.8-27B,oMLX 8bit,短上下文/32K約 22.8/20.3 tokens/s未提供同上
M5 Max 128GBQwen3.8-27B,Ollama 4bit約 25 tokens/s未提供霖落小屋,2026-08-21
M5 Max 128GBDeepSeek V4 Flash 0731,q2/q4 量化約 40 tokens/s300–700 tokens/s(依上下文長度)Chaos,2026-09-03
M5 Max 128GBQwen3.8-Flash-Next,IQ4_XS,200K 輸入,llama.cpp 調校後約 50 tokens/s(調校前的 2.8 倍)較調校前提升 85%老杨,2026-08-28

前兩列放在一起看最有意思。M3 Ultra 的頻寬是 819 GB/s,M5 Max 是 614 GB/s,兩者比例約 1.33;同一個模型的輸出速度 22.8 對 17.8,比例約 1.28。新一代晶片跑輸舊一代,原因就是 decode 階段 GPU 大多在等資料從記憶體搬過來。照同一個比例推算,頻寬 1.2 TB/s 的 M5 Ultra 跑這個 27B 8bit 模型大約會落在 33–35 tokens/s,這是依頻寬比例的推估,實際數字要等社群實測。

看到很高的 tokens/s,先問三件事

量化是幾 bit、有沒有開 MTP 投機解碼、上下文多長。同一篇社群實測指出,Qwen3.8-27B 在 RTX 5090 上開不開 MTP,速度從 66 跳到 121 tokens/s;M5 Max 同一個模型從 4bit 未加速的 25 tokens/s,到最佳化 4bit 加 MTP 的 50–60 tokens/s,也是一倍的落差。沒有寫明這三件事的數字,無法拿來比較機器。

三、M5 真正的升級在 prefill:Neural Accelerator 幫了什麼

M5 每個 GPU 核心都內建 Neural Accelerator,讓讀入長輸入的 prefill 快兩倍以上;decode 幾乎不受影響,而且推理框架要支援新的加速路徑才吃得到。

Mac Studio M5 跑 LLM 的 prefill 與 decode 瓶頸對照圖|蓋斯克科技
左側為 prefill:同一台 M5 Max 開啟 Neural Accelerator 加速路徑後,gpt-oss-120b 讀入速度從 877 提升到 1,833 tokens/s;右側為 decode:M5 Max、M3 Ultra、M5 Ultra 與 RTX 5090 的記憶體頻寬對照(數據為社群實測,實際依模型與軟體版本而異)

三組彼此獨立的數據都指向同一個結論:

  • 學術論文BaseRT 論文(arXiv 2607.19438,2026-07-21)在 M5 Pro 上測了 15 組模型配置,prefill 吞吐量最高比 llama.cpp 快 6.4 倍、比 MLX 快 3.9 倍,MoE 模型的提升最多;decode 最多只領先 llama.cpp 1.75 倍、MLX 1.33 倍。
  • 同機開關對照晏知微 2026-08-31 整理的 LM Studio 對照測試,在同一台 M5 Max 上切換加速路徑,gpt-oss-120b 的 prefill 從 877 提升到 1,833 tokens/s(2.09 倍),Step-3.7-Flash 從 342 提升到 833 tokens/s(2.44 倍),decode 完全沒變。
  • 跨世代對照郝天 2026-03-21 整理的社群數據中,M5 Max 跑 Qwen3-Coder-Next 8bit 的 prompt processing 峰值達 4,468 tokens/s,M4 Max 為 1,855、M3 Ultra 為 2,959。

推理框架的選擇也會跟著上下文長度改變。一份轉述自國外的 M4 Max 對照測試顯示,短上下文用 MLX 搭配投機解碼,輸出速度約快 1.7–1.86 倍;上下文拉到 100K 以上,llama.cpp 反而較快;200K 以上 MLX 的 prefill 與 decode 都下降明顯。日常對話與短任務用 MLX,長文件與大型程式碼庫用 llama.cpp,是目前社群比較一致的做法。

四、為什麼 Mac 聊天夠快,跑 Agent 卻慢?

Agent 每一輪都要重新讀入系統指令、工具定義與累積的對話歷史,prefill 的次數與長度遠多於聊天;快取沒有命中時,每一輪都在重算同一段內容。

一般聊天的輸入短、輸出長,體感幾乎全由 decode 決定,Mac 在聊天情境表現不錯。程式 Agent 的輸入動輒數萬 token,包含整份專案規則、工具說明、讀進來的程式碼與錯誤訊息,模型每做一步都要重讀一次。社群一篇文章的標題直接點出這個落差:「聊天真香、Agent 卻沒那麼爽」。

同一篇 M5 Ultra 實測整理引用的一組 Agent 編碼對照很值得參考:本地最佳組合雖然任務全數通過,完成時間是 975 秒,託管的前沿模型只要 203 秒,慢了約 4.8 倍。文中也記錄到一個常見狀況:KV 快取完全沒有命中,每一輪都在 40K 上下文下全量重新 prefill。這種狀況發生時,換更貴的機器改善有限,要先修設定。

李小肥的YY 2026-09-11 整理了一組把兩個階段拆開的測試,用 Llama-3.1 8B、輸入 8,192 token、輸出 32 token:DGX Spark 單機 prefill 1.47 秒、生成 2.87 秒;M3 Ultra Mac Studio 單機 prefill 5.57 秒、生成 0.85 秒;讓 Spark 負責 prefill、Mac 負責生成,總時間降到 2.32 秒,比 Mac 單機快 2.8 倍。這種分離式架構仍屬實驗性質,但它清楚說明了 Mac 的長處在後半段。M5 世代的 prefill 已大幅改善,這個差距會縮小。

在 Mac 上跑 Agent,下面幾個設定比升級機器更優先:

設定項目為什麼重要做法與代價適用情境
確認前綴快取有命中系統指令與工具定義每輪相同,命中快取就不必重算觀察框架日誌的快取命中率;避免在提示詞開頭放時間戳這類每次都變的內容所有 Agent 任務
不要用 parallel 參數把上下文切碎社群實測中,llama.cpp 設 --parallel 4 會讓 131K 上下文被平分成每個 slot 只剩 32K單人使用時設為 1,確保 Agent 拿到完整上下文需要 128K 以上上下文的 Agent
KV 快取量化長上下文時 KV 快取會吃掉大量記憶體社群在一台 64GB 舊款 Mac 上實測,q8 省約 4.7GB、速度降約 30%;q4 省更多、速度降約 41%記憶體不足時才用
投機解碼讓小草稿頭先猜多個 token,主模型一次驗證支援 MTP 的模型開啟後,輸出速度常見提升一倍左右,會多吃一些記憶體單人、低並發
散熱與效能模式長時間高負載會降頻,數字看起來像「上下文一長就斷崖」保持通風,選用框架的高效能模式,長任務前先確認溫度連續數小時的 Agent 任務

資料來源:老杨,2026-08-28邵奈一,2026-08-19

想知道你的環境適不適合導入 AI?

LINE 傳訊描述你的設備規模,免費給你初步可行性評估,不用先約不用先付錢。

LINE 詢問 AI 導入 → 預約免費健診

五、M5 Ultra 256GB、512GB 能跑多大的模型?

256GB 能單機裝下 DeepSeek-V4-Flash 的 4-bit 等級量化版,512GB 才碰得到 200B 以上更大模型;容量加大讓模型塞得進去,輸出速度還是看頻寬。

統一記憶體社群實測或推估能跑的模型要注意
64GB27B 級模型 4–8bit;社群常見說法是跑本地程式 Agent 的起點長上下文 Agent 會很快吃滿記憶體
128GB(M5 Max 上限)DeepSeek V4 Flash 0731 的 q2/q4 量化、Qwen3.8-Flash-Next IQ4_XS(約 87GB)超低位元量化會影響品質;96GB 與 128GB 被部分社群認為是尷尬尺寸
256GBDeepSeek-V4-Flash MXFP4 完整版(約 156GB),社群實測 200K 上下文峰值約 172GBM5 Ultra 256GB 的 DeepSeek V4 Flash 速度目前是推估值
512GB(10 月底出貨)社群整理指出騰訊 Hy4-preview 最小量化約 213GB,需要 512GB 機型容量翻倍,decode 速度不會跟著翻倍

資料來源:晏知微,2026-08-31Chaos,2026-09-03HiroshiYa,2026-08-27

擁有 M5 Max 128GB 的社群用戶 Chaos 對 M5 Ultra 256GB 做了推估:跑完整的 MXFP4 版 DeepSeek V4 Flash,prefill 約 600–1,200 tokens/s、decode 約 80 tokens/s。他也列了同價位的對手:兩台 DGX Spark 價格相近,載入速度可到約 1,700 但輸出約 40;兩張 RTX PRO 6000 載入 3,000–4,000、輸出 60–70,價格約高一倍。這組比較把三條路線的取捨講得很清楚。

用多台 Mac 串接擴充容量也有人做過。社群轉述的一個例子是四台 Mac Studio 以 Thunderbolt 5 串成約 1.5TB 記憶體跑 671B 模型,單機約 21.1 tokens/s,四台串起來約 31 tokens/s。容量可以疊加,速度卻只提升不到一半。另外 HiroshiYa 指出,M5 仍不支援 FP4、FP8 原生運算,這是 Mac 與 DGX Spark 這類平台的差異之一。

六、Mac Studio 可以當團隊共用的 AI 主機嗎?

Mac 的強項是單一使用者;多個請求同時進來時,吞吐與延遲都比獨立顯卡搭配 vLLM 的服務架構弱,社群的看法相當一致。

在知乎「M5 Ultra Mac Studio 值不值得買」的問題底下,反對者最常提的理由就是並發。一則回答形容得很直接:一個人用速度尚可,兩個人就降速,人更多就撐不住。另一位已經買了 M3 Ultra 512GB 的用戶也說,跑 DeepSeek V4 Flash 很愉快,但別指望並發,要並發還是買 RTX PRO 6000 跑 27B 模型。

原因跟推理框架有關。Mac 上主流的 MLX 與 llama.cpp 以單機、單使用者為主要設計目標,多用戶服務需要的連續批次處理、分頁式 KV 快取管理,在 NVIDIA 平台上的 vLLM、SGLang 更成熟。這個分界線跟〈Ollama 可以上企業生產環境嗎〉講的是同一件事:個人工具與服務化框架的設計目標不同。

團隊要共用,單張專業顯卡能撐幾個人、容量怎麼估,整理在同系列的〈一張 RTX PRO 6000 撐得起幾個人?〉。

七、該選 M5 Max、M5 Ultra,還是別買 Mac?

先確認使用人數與主要任務:單人、短任務選 Mac 很合理;多人共用或以長上下文 Agent 為主,Mac 通常排不上第一順位。

你的情境建議方向理由
單人、已在 Apple 生態系、主要跑 30B 以下模型M5 Max 64GB–128GB安靜、低功耗、日常泛用;27B 級模型搭配投機解碼有實用速度
單人、需要本機跑 100B 以上 MoE 或 DeepSeek V4 FlashM5 Ultra 256GB容量足夠單機載入,頻寬是 M5 Max 的兩倍
以長上下文程式 Agent 為主先驗證 prefill 與快取設定,再比較 prefill 更強的平台Agent 的瓶頸在 prefill 次數,單看 decode 速度會誤判
5 人以上共用、需要穩定吞吐不建議以 Mac 為主力,改看獨立顯卡加 vLLM社群實測與經驗都顯示 Mac 並發表現弱
還不確定要買哪一台先租賃試用,用實際工作量決定硬體與記憶體價格仍在波動,二手折價也快

不確定要不要一次買斷,可以參考蓋斯克的設備租賃方案,先用實際工作量試一段時間。地端與雲端 API 兩條路線整體划不划算,〈地端 LLM 建置完整指南〉有完整的成本比較;模型需要多少記憶體,可以用〈LLM 主機規格怎麼抓〉的對照表先估算。

八、蓋斯克怎麼評估

蓋斯克科技目前沒有 Mac Studio M5 的自有實測,本篇所有速度數字都來自上方註明的社群公開資料。[需提供蓋斯克 Mac Studio 實測數據或客戶導入案例:機種與記憶體、模型與量化、使用人數、實測 decode/prefill,以及導入前後的變化。若暫無,發佈時可刪除本節。]

結論:Mac 讓大模型跑得起來,團隊用得順要另外規劃

Mac Studio 跑地端 LLM 三大重點結論字卡|蓋斯克科技
  • decode 看頻寬:M5 Max 614 GB/s、M5 Ultra 1.2 TB/s,同一個模型的輸出速度大致照這個比例走,新晶片名稱不代表輸出一定更快。
  • prefill 是 M5 的強項:Neural Accelerator 讓讀入長輸入快兩倍以上,前提是推理框架有支援,選購前先確認你要用的軟體版本。
  • Agent 與多人是兩道門檻:Agent 要先把快取與上下文設定做對;多人共用則建議直接評估獨立顯卡的服務架構。

立即開始:你的地端 LLM 主機值得一次選對

蓋斯克科技協助台灣中小企業評估地端 AI 基礎建設,從單機開發環境到多人共用的生產架構,依實際使用情境給建議,不先推銷特定機種。

我們提供:

  • 依你的使用人數、常用模型與上下文長度,判斷 Mac 還是獨立顯卡較合適
  • 2026 年市場報價區間與硬體規格對照,避免用過時資訊做決策
  • 透明報價,無隱藏費用
  • 設備租賃與採購兩種路線並陳,先試用再決定

想先用實際工作量試試 Mac 或其他地端 LLM 主機?

蓋斯克科技提供AI 導入評估服務,先確認需求規模,再決定要不要投資硬體。

AI導入評估 免費預約諮詢

電話:02-2717-1019 LINE:@zonetech

關於作者

Gask Hung|蓋斯克科技創辦人,專注台灣中小企業 IT:企業 Wi-Fi、4K 剪輯系統、IT 委外與設備租賃,近期投入地端 LLM 導入評估。完整作者介紹

延伸閱讀:地端 LLM 主機大車拼一張 RTX PRO 6000 撐得起幾個人?設備租賃服務

更多關於 Mac Studio 跑地端 LLM 的常見問題FAQ

Q1:Mac Studio M5 Max 128GB 能跑多大的模型?

社群實測中,M5 Max 128GB 可以跑 DeepSeek V4 Flash 的 q2/q4 量化版,輸出約 40 tokens/s,也能跑約 87GB 的 Qwen3.8-Flash-Next IQ4_XS。27B 級模型則相當從容,搭配投機解碼可達 50–60 tokens/s。

Q2:M5 Ultra 值得多花十幾萬嗎?

要看你需不需要 128GB 以上的容量。M5 Ultra 的頻寬是 M5 Max 的兩倍,最高 512GB,適合單人跑 100B 以上的 MoE 模型。主要跑 27B 級模型的話,M5 Max 加上投機解碼通常已經夠用。

Q3:為什麼 Mac 跑 Agent 比聊天慢很多?

Agent 每一輪都要重讀系統指令、工具定義與對話歷史,輸入往往數萬 token,prefill 次數遠多於聊天。快取沒命中時每輪都在重算。先確認前綴快取命中、上下文沒有被切碎,再考慮換機器。

Q4:一台 Mac Studio 可以給 5 到 10 個人共用嗎?

不建議當主力。社群經驗普遍指出 Mac 一個人用尚可,多人同時請求時速度下降明顯。團隊共用建議評估獨立顯卡搭配 vLLM 這類服務化框架,並在採購前用實際工作量壓測。

Q5:Mac 上該用 MLX、llama.cpp 還是 Ollama?

依上下文長度選。社群對照測試顯示,短上下文用 MLX 搭配投機解碼輸出較快;100K 以上長上下文 llama.cpp 表現較好。Ollama 上手最快,適合先驗證流程,追求速度再換框架調校。

Q6:Mac Studio 和 DGX Spark 該怎麼選?

DGX Spark 的 prefill 強、有 CUDA 與原生 FP4;Mac Studio 的頻寬較高,逐字輸出較順,日常泛用性也較好。長輸入與 CUDA 生態優先選 Spark,單人對話與 Apple 生態系優先選 Mac。完整比較見母文〈地端 LLM 主機大車拼〉。

蓋斯克科技

企業級網路規劃
電話:02-27171019
商家:https://g.page/zonetech-tw
地址:10491臺北市中山區建國北路二段125號4樓

分享至Facebook

精選文章

📍 服務地區

台北辦公室網路規劃 新北企業資訊委外 台北IT委外服務 新北網路建置規劃 台北設備租賃 新北設備租賃