作者:Gask Hung|發布:2026-09-14|最後更新:2026-09-14
〈地端 LLM 主機大車拼〉的結論是:5 到 20 人要共用,應該看高頻寬的獨立顯卡。接著最常被問的問題是「那一張卡到底撐幾個人」。廠商規格表與社群貼文常出現「吞吐量破千 tokens/s」這種數字,看起來一張卡能服務整個部門。實際換算會發現,那是所有請求加總的產量。社群一組實測裡,單張 RTX PRO 6000 同時處理 32 個請求時總吞吐 491.8 tokens/s,平均分到每個人只剩約 15 tokens/s。判斷一張 96GB 顯卡能不能撐起團隊,要看每人分到的速度:模型控制在 27B 級、開啟 FP8 KV 快取與前綴快取、用 vLLM 服務化,再用團隊真實的工作量壓測,才算得出能給幾個人用。
📋 本文重點摘要
- 規格:RTX PRO 6000 為 96GB、1,792 GB/s、600W;RTX PRO 5000 72GB 為 1,344 GB/s、300W,多卡都走 PCIe 5.0
- 總吞吐會隨並發上升,每人速度會下降:單卡 PRO 5000 72GB 真實 Agent 流量中,並發從 1 到 5,每人速度從 58.6 降到約 27 tokens/s
- 96GB 單卡可放 INT4 量化的 106B 級 MoE;235B 級 INT4 約 124.5GB,要兩張卡
- PRO 6000 美國官方價在 2026 年 8 月調到 US$16,000,較首發漲近九成;社群回報 PRO 5000 72GB 的渠道價明顯較低
👤 適合閱讀對象
- 工程主管:想讓十個工程師共用一台本地模型跑程式 Agent,需要知道一張卡到底夠不夠
- IT 採購:RTX PRO 6000 的報價一路上漲,想確認 PRO 5000 72GB 能不能替代
- 系統整合商:要寫單卡推理伺服器的提案,需要一套能向客戶解釋的容量估算方法
不確定你的團隊要幾張卡?加 LINE 傳使用人數、常用模型和平常的上下文長度,我們先幫你估算容量與並發 → 加 LINE 諮詢

一、RTX PRO 6000 與 PRO 5000 72GB 規格差在哪?
兩張都是 Blackwell 架構的專業顯示卡;PRO 6000 多了 24GB 顯存與約三成的記憶體頻寬,代價是功耗加倍與價格高出一截。

RTX PRO 6000 Blackwell 是 NVIDIA 的專業工作站顯示卡,搭載 96GB ECC 顯存,用於大模型推論、微調與專業繪圖。團隊共用的情境下,顯存決定能放多大的模型與多少人的對話狀態,記憶體頻寬決定每個字吐得多快。
| 型號 | 顯存 | 記憶體頻寬 | 功耗 | 價格參考 | 適用情境 |
|---|---|---|---|---|---|
| RTX PRO 6000 工作站版 | 96GB GDDR7 ECC | 1,792 GB/s | 600W | NVIDIA 美國官方商城 US$16,000(2026-08) | 100B 級 MoE、同時掛多個模型 |
| RTX PRO 6000 Max-Q 工作站版 | 96GB GDDR7 ECC | 未於官方規格表列出 | 300W | [需確認報價] | 多卡工作站,控制散熱與電力 |
| RTX PRO 6000 伺服器版 | 96GB GDDR7 ECC | 1,597 GB/s | 400–600W | [需確認報價] | 機架式多卡伺服器、需要 MIG 切分 |
| RTX PRO 5000 72GB | 72GB GDDR7 ECC | 1,344 GB/s | 300W | [需確認台灣報價] | 模型固定在 27B–35B 級、壓低成本與功耗 |
資料來源:功耗依 NVIDIA RTX PRO 6000 產品頁;PRO 5000 72GB 規格依麗臺官方產品頁;PRO 6000 頻寬依立方云引述 NVIDIA 官方頁面;價格依 XFastest,2026-08-13
NVIDIA 在 2025 年 12 月發表 72GB 版本時,把它定位在桌面端的代理式 AI 開發:
讓開發者在本地訓練、微調與原型開發更大的模型。
NVIDIA 官方部落格,2025 年 12 月 18 日(原文為英文,蓋斯克翻譯)
用〈大車拼〉的頻寬公式驗算一次:一個約 27GB 的 27B 8bit 模型,PRO 6000 的理論輸出上限約 1,792 ÷ 27 ≈ 66 tokens/s,PRO 5000 72GB 約 1,344 ÷ 27 ≈ 50 tokens/s。一位持有 PRO 6000 的社群用戶回報 Qwen 27B Q8 以 llama.cpp 實測 decode 約 44 tokens/s、prefill 約 1,600 tokens/s,達成率約三分之二,屬於合理範圍。
二、「吞吐量破千」和「每個人多快」是兩回事
總吞吐是所有請求加起來的產量,每個人等待的速度要用總吞吐除以同時處理的請求數;並發越高,總量越大、每人越慢。
一個好懂的比喻:一張顯示卡像一個收費站。收費站一小時能放行的總車數會隨著開放車道增加,看起來效率很高;每位駕駛在意的卻是自己排多久。車道越開越多,總通過量上升,每條車道分到的處理速度下降。規格表上的吞吐量是收費站的總通過量,使用者感受到的是自己那條車道。

目前最有參考價值的是李众力 2026-08-26 公開的數據:單卡 RTX PRO 5000 72GB、Qwen3.8-27B NVFP4 量化、vLLM、262K 上下文,服務十幾個全天候運作的 AI Agent。數據來自 vLLM 每 10 秒自動記錄的運行快照,使用 MTP3 投機解碼期間累積 13 天、51,711 筆,屬於真實流量,並非合成跑分。依並發分桶的中位數如下:
| 同時處理的請求數 | 總吞吐(tokens/s) | 每人分到的速度(蓋斯克換算) |
|---|---|---|
| 1 | 58.6 | 58.6 |
| 2 | 88.8 | 44.4 |
| 3 | 120.4 | 40.1 |
| 4 | 134.2 | 33.6 |
| 5 | 136.4 | 27.3 |
| 6–8 | 129.9 | 約 16–22 |
資料來源:李众力,〈DFlash2 vs MTP3:單卡 27B 模型投機解碼實測〉,2026-08-26
並發到 4 以後總吞吐幾乎不再增加,代表這張卡的算力已經接近滿載,再多加使用者只會把同一份產量分得更細。另一組數據來自 2026-08-29 的社群整理:單張 PRO 6000 搭配 100GB 系統記憶體跑 Qwen3.8-Flash-Next 的量化方案,單並發約 76.4 tokens/s,32 並發總吞吐 491.8 tokens/s,換算每人約 15.36 tokens/s,整理者自己的評語是「已經快用不了了」。
多卡也是同樣的邏輯。一份 4 張 RTX PRO 5000 72GB 跑 DeepSeek-V4-Flash NVFP4 的評測顯示,4K 輸入在 16 並發時平均總吞吐約 179 tokens/s,換算每人約 11 tokens/s;20K 輸入的 Agent 任務適合 8–16 並發,40K 長上下文降到 4–8 並發,KV 快取成為主要限制。
看到吞吐數字,先驗算塞不塞得進去
社群有一篇文章宣稱單張 RTX PRO 6000 以 FP16 精度跑 80B 模型、吞吐近 1,000 tokens/s。80B 參數以 FP16 計算,每個參數 2 bytes,光權重就約 160GB,放不進 96GB 的顯存;原文也沒有寫明並發數。這類數字可能混用了量化版本或多卡環境,本篇不採用。用〈LLM 主機規格怎麼抓〉的公式先算權重大小,是過濾可疑數字最快的方法。
三、96GB 能放哪些模型?容量估算三步驟
先算權重,再算每個使用者的 KV 快取,最後保留運行餘量;MoE 模型的權重按總參數算,KV 快取由注意力層決定。
- 算權重:參數量乘以每個參數的位元組數。FP16 約 2 bytes、FP8 約 1 byte、INT4 約 0.5 byte。MoE 模型雖然每個 token 只啟用部分參數,全部權重仍要放進顯存。
- 算 KV 快取:KV 快取是模型為每段對話保存的中間狀態,會隨上下文長度與同時在線的人數線性增加。團隊共用時,這一項常常比權重更早把顯存吃完。
- 留運行餘量:CUDA 執行環境、框架工作區與啟動時的暫存都要空間,數字以推理框架的啟動日誌為準。
新一代混合注意力模型大幅降低了第二步的壓力。社群對 Qwen3.8-27B 架構的解析指出,它 64 層裡只有 16 層使用完整注意力,其餘 48 層改用只保留固定大小狀態的線性注意力,KV 快取約為同尺寸傳統模型的四分之一。另一篇社群實測量到每個 token 約 22KB,32K 上下文約 2GB。照這個數字粗估,10 個人各開 32K 上下文約需 20GB KV 快取,加上約 27GB 的 FP8 權重,一張 96GB 的卡還留有餘裕。這是容量上的估算,速度能不能讓 10 個人都滿意,要回到上一節的並發數據。

| 模型 | 權重大小(量化) | 單張 96GB | 單張 72GB | 說明 |
|---|---|---|---|---|
| Qwen3.8-27B | FP8 約 27GB;NVFP4 更小 | 可以,KV 餘量充足 | 可以,社群實測 NVFP4 開 262K 上下文 | 目前團隊共用最常見的主力尺寸 |
| GLM-4.5-Air(106B 總參數、約 12B 啟用) | INT4 約 60–70GB | 可以,剩約 20–30GB 給 KV | 勉強,KV 餘量太少 | 適合高品質、低並發 |
| Qwen3.8-Flash-Next(125B 主模型+51B 嵌入參數) | 混合 NVFP4 | 可以,需搭配約 100GB 系統記憶體卸載 | 未見社群方案 | 單卡方案仍在快速演進 |
| Qwen3-235B-A22B | 官方 GPTQ-Int4 約 124.5GB | 不行,需 2 張 | 不行 | 兩張 96GB 張量並行,餘約 60GB 給 KV |
| DeepSeek-V4-Flash-0731(284B) | NVFP4 約 176GB | 不行,需 2 張 | 不行,社群評測用 4 張 | 兩張 PRO 6000 張量並行是社群較完整的方案 |
資料來源:立方云,〈RTX PRO 6000 96GB 能部署哪些大模型〉,2026-09-08(其文中明言數字為容量規劃用途,非實測);error,2026-08-29
四、團隊共用該選 RTX PRO 6000 還是 PRO 5000 72GB?
模型固定在 27B–35B 級、要壓低成本與功耗時,PRO 5000 72GB 通常夠用;要放 100B 級 MoE、同時掛多個模型,或需要更多 KV 空間服務長上下文,才需要 96GB。
價格是這一年最大的變數。XFastest 2026 年 8 月 13 日報導,PRO 6000 工作站版在 NVIDIA 美國官方商城的標價從首發約 US$8,565、6 月的 US$13,250,調到 8 月的 US$16,000。知乎上一位通路相關回答者提到,PRO 6000 的中國渠道價半個月內從含稅約 7.5 萬漲到 11.5 萬人民幣,同時觀察到 PRO 5000 72GB「便宜好多」;另一位供應高校課題組的回答者也判斷,後續可能有人轉用 PRO 5000。台灣報價波動大,下單前務必取得當期書面報價。
| 比較維度 | RTX PRO 6000(96GB) | RTX PRO 5000(72GB) | 適用情境 |
|---|---|---|---|
| 理論輸出速度(27B 8bit) | 約 66 tokens/s | 約 50 tokens/s | 每人速度敏感的互動式使用,PRO 6000 較有餘裕 |
| 可放的模型上限 | 106B 級 MoE INT4 | 35B 級較從容 | 要跑 100B 級模型只能選 96GB |
| 功耗與散熱 | 工作站版 600W | 300W | 一台機器插多張卡、辦公室環境,PRO 5000 較好處理 |
| 價格走勢 | 2026 年大幅上漲 | 社群回報相對便宜 | 預算固定、只跑 27B 級模型時,PRO 5000 CP 值較高 |
| MIG 切分 | 伺服器版支援 | 最多切 2 個 36GB 實例 | 要把一張卡隔離給不同部門使用時 |
五、讓一張卡服務多人的五個設定
用 vLLM 或 SGLang 提供服務,加上 API 閘道、FP8 KV 快取、前綴快取、投機解碼與 CUDA Graph,同一張卡的表現可以差上好幾倍。
軟體設定的影響有多大,社群一組兩張 PRO 6000 跑 DeepSeek-V4-Flash-0731 的調校紀錄可以說明:未最佳化的 eager 模式只有 17.8 tokens/s,開啟 CUDA Graph 後到 77.1,再經過核心調校、投機解碼與 MoE 核心替換,最後到 202.7 tokens/s,同樣的硬體相差超過 11 倍。

| 設定 | 做什麼 | 效果與代價 | 適用情境 |
|---|---|---|---|
| vLLM 服務化加 API 閘道 | 提供 OpenAI 相容 API,閘道負責帳號、配額與用量統計 | 團隊成員用現有 SDK 直接串接;社群常見搭配是 New-API 閘道 | 所有多人共用情境 |
| FP8 KV 快取 | vLLM 的 --kv-cache-dtype fp8 | KV 快取占用約減半,可服務更多人或更長上下文;極端情況的精度影響需自行評估 | 長上下文、多人同時在線 |
| 前綴快取 | 系統指令與工具定義相同的請求,重用已算好的結果 | 社群實測在 Agent 場景提速明顯,幾乎沒有代價 | Agent、共用同一套系統提示詞的團隊 |
| 投機解碼 | 草稿模型或 MTP 頭先猜多個 token,主模型一次驗證 | 單卡 27B 實測中,DFlash2 在單一請求時達 MTP3 的 3.13 倍,並發升高後兩者趨近 | 低並發、每人速度優先 |
| 保留 CUDA Graph | 不要為了除錯開 --enforce-eager | 社群一組 4 卡叢集只拿掉這個參數,每 token 延遲從 131ms 降到 32ms | 所有生產環境 |
資料來源:立方云,2026-09-08;李众力,2026-08-26;卡卡带我飞,2026;pine,2026-04-16(API 閘道做法)
投機解碼那一列值得多看一眼。李众力的數據裡,DFlash2 在並發 1 時把速度從 58.6 拉到 183.1 tokens/s,並發 3 到 4 時只剩一成左右的提升。原因是低並發時瓶頸在逐字解碼,投機解碼正好解決它;並發一高,瓶頸移到整張卡的算力總量,猜得再準也沒有多餘算力可用。團隊人數少、每人要快,投機解碼最划算;人數多,要靠加卡。Ollama 與 vLLM 在多人情境的完整差異,見〈Ollama 可以上企業生產環境嗎〉。
六、一張卡不夠時,擴充到兩張、四張要注意什麼?
RTX PRO 6000 沒有 NVLink,多卡之間走 PCIe 5.0 x16,張量並行的通訊開銷會吃掉一部分效能;四張 72GB 也不等於一塊連續的 288GB。
立方云提醒,NVIDIA 官方規格頁列出的系統介面是 PCIe 5.0 x16,沒有 NVLink 選項,卡間通訊都走 PCIe。4 張 PRO 5000 72GB 的評測作者也特別註明,每張卡的記憶體彼此獨立,張量並行分配與每張卡各自的快取需求,會讓有效容量低於四張相加。
什麼時候值得擴到四張?一個遊戲研發團隊 2026-08-31 分享的選型歷程很有參考價值。他們從小模型逐步驗證:7B 能生成程式碼但扛不住複雜 Agent 提示;32B 開始具備 Agent 形態,卻容易只規劃不動手;72B 稠密模型能力明顯提升,但 16K–32K 的上下文很快被專案規則與日誌塞滿。最後用 4 張 PRO 6000 部署 DeepSeek-V4-Flash,提供 256K 服務上下文、約 133 tokens/s,才接近他們要的「團隊級本地主腦」。他們的心得是:參數量決定能力門檻,上下文決定 Agent 能不能持續工作。
多卡伺服器通常放進機房長時間運轉,網段隔離與存取控制要一起規劃,做法見〈AI 防火牆怎麼建置〉;整體建置流程與地端、雲端的成本比較,見〈地端 LLM 建置完整指南〉。
七、蓋斯克怎麼評估
蓋斯克科技目前沒有 RTX PRO 6000 或 PRO 5000 72GB 的自有壓測數據,本篇數字都來自上方註明的社群公開資料與原廠規格。[需提供蓋斯克實測或客戶導入案例:卡型與張數、模型與量化、實際使用人數、每人速度與尖峰並發、導入前後的變化。若暫無,發佈時可刪除本節。]
結論:先定每人要多快,再算要幾張卡

- 吞吐要換算成每人速度:社群真實流量中,單卡並發到 4–5 後總吞吐就接近上限,再多人只是把同一份產量分得更細。
- 容量先驗算:權重、KV 快取、運行餘量三步算完,27B 級混合注意力模型是目前單卡服務多人最實際的選擇。
- 軟體設定優先於加卡:CUDA Graph、FP8 KV 快取、前綴快取與投機解碼,同一張卡能差上數倍,採購前用團隊真實工作量壓測。
立即開始:你的團隊 LLM 伺服器值得一次算清楚
蓋斯克科技協助台灣中小企業評估地端 AI 基礎建設,從單機開發環境到多人共用的生產架構,依實際使用情境給建議,不先推銷特定機種。
我們提供:
- 依使用人數、常用模型與上下文長度,估算需要的顯存與卡數
- 2026 年顯示卡市場報價區間,避免用過時價格做預算
- 透明報價,無隱藏費用
- 設備租賃與採購兩種路線並陳,先用真實工作量壓測再決定
顯示卡一路漲價,想先租來壓測再決定要不要買?
蓋斯克科技提供企業設備租賃與地端 AI 導入評估服務,先確認需求規模,再決定要不要投資硬體。
了解設備租賃方案 免費預約諮詢電話:02-2717-1019 LINE:@zonetech
關於作者
Gask Hung|蓋斯克科技創辦人,專注台灣中小企業 IT:企業 Wi-Fi、4K 剪輯系統、IT 委外與設備租賃,近期投入地端 LLM 導入評估。完整作者介紹
延伸閱讀:地端 LLM 主機大車拼|Mac Studio M5 跑地端 LLM 實測整理|設備租賃服務
更多關於 RTX PRO 6000 團隊共用的常見問題FAQ
Q1:一張 RTX PRO 6000 可以給幾個人用?
沒有固定答案,要看模型、上下文長度與每人可接受的速度。社群真實流量中,單卡 27B 模型並發到 4–5 時總吞吐接近上限,每人約 27–34 tokens/s;並發到 32 時每人只剩約 15 tokens/s。建議用團隊實際工作量壓測決定。
Q2:RTX PRO 5000 72GB 夠用嗎?
模型固定在 27B–35B 級時通常夠用。社群已有單卡 PRO 5000 72GB 跑 Qwen3.8-27B、262K 上下文服務十幾個 Agent 的實例。要放 100B 級 MoE 或同時掛多個模型,才需要 96GB。
Q3:RTX 5090 32GB 可以拿來給團隊共用嗎?
小團隊可以試,但容量很緊。27B 模型 FP8 權重約 27GB,放進 32GB 後留給多人 KV 快取的空間很少。頻寬與 PRO 6000 相同,瓶頸落在同時能服務的人數與上下文長度。
Q4:團隊共用要用 vLLM 還是 Ollama?
多人共用建議用 vLLM 或 SGLang。它們有連續批次處理與分頁式 KV 快取管理,搭配 API 閘道能管理帳號與配額。Ollama 適合個人或概念驗證,多人同時請求時容易成為瓶頸。
Q5:買一張 PRO 6000,還是多張 RTX 5090?
看模型大小與並發型態。社群一組 230B 模型測試中,單張 PRO 6000 與四張 5090 的單序列速度幾乎打平,功耗 600W 對約 2,300W;多人同時請求時,多卡可分流而總吞吐較高。模型放得進單卡就優先單卡。
Q6:顯示卡一直漲價,該買還是先租?
還不確定團隊實際用量時,建議先租賃壓測。PRO 6000 美國官方價一年半漲近九成,模型也在快速變小變強,先用真實工作量確認需要幾張、哪一型,再決定採購,比一次到位風險低。





