資訊設備大小事

一張 RTX PRO 6000 撐得起幾個人?單卡團隊 LLM 伺服器的並發、KV 快取與 PRO 5000 72GB 比較

2026-09-17
蓋斯克科技工程師安裝RTX PRO 6000團隊推理伺服器|企業地端LLM
一張 RTX PRO 6000 能給幾個人共用?整理社群實測:總吞吐與每人速度的差距、96GB 能放哪些模型、FP8 KV 快取與投機解碼設定,以及 RTX PRO 5000 72GB 能不能替代。

作者:Gask Hung|發布:2026-09-14|最後更新:2026-09-14

地端 LLM 主機大車拼〉的結論是:5 到 20 人要共用,應該看高頻寬的獨立顯卡。接著最常被問的問題是「那一張卡到底撐幾個人」。廠商規格表與社群貼文常出現「吞吐量破千 tokens/s」這種數字,看起來一張卡能服務整個部門。實際換算會發現,那是所有請求加總的產量。社群一組實測裡,單張 RTX PRO 6000 同時處理 32 個請求時總吞吐 491.8 tokens/s,平均分到每個人只剩約 15 tokens/s。判斷一張 96GB 顯卡能不能撐起團隊,要看每人分到的速度:模型控制在 27B 級、開啟 FP8 KV 快取與前綴快取、用 vLLM 服務化,再用團隊真實的工作量壓測,才算得出能給幾個人用。

📋 本文重點摘要

  • 規格:RTX PRO 6000 為 96GB、1,792 GB/s、600W;RTX PRO 5000 72GB 為 1,344 GB/s、300W,多卡都走 PCIe 5.0
  • 總吞吐會隨並發上升,每人速度會下降:單卡 PRO 5000 72GB 真實 Agent 流量中,並發從 1 到 5,每人速度從 58.6 降到約 27 tokens/s
  • 96GB 單卡可放 INT4 量化的 106B 級 MoE;235B 級 INT4 約 124.5GB,要兩張卡
  • PRO 6000 美國官方價在 2026 年 8 月調到 US$16,000,較首發漲近九成;社群回報 PRO 5000 72GB 的渠道價明顯較低

👤 適合閱讀對象

  • 工程主管:想讓十個工程師共用一台本地模型跑程式 Agent,需要知道一張卡到底夠不夠
  • IT 採購:RTX PRO 6000 的報價一路上漲,想確認 PRO 5000 72GB 能不能替代
  • 系統整合商:要寫單卡推理伺服器的提案,需要一套能向客戶解釋的容量估算方法

不確定你的團隊要幾張卡?加 LINE 傳使用人數、常用模型和平常的上下文長度,我們先幫你估算容量與並發 → 加 LINE 諮詢

蓋斯克科技工程師安裝RTX PRO 6000團隊推理伺服器|企業地端LLM
蓋斯克科技工程師安裝團隊共用推理伺服器

一、RTX PRO 6000 與 PRO 5000 72GB 規格差在哪?

兩張都是 Blackwell 架構的專業顯示卡;PRO 6000 多了 24GB 顯存與約三成的記憶體頻寬,代價是功耗加倍與價格高出一截。

RTX PRO 6000 vs PRO 5000 72GB規格比較|蓋斯克科技
RTX PRO 6000與PRO 5000 72GB規格比較

RTX PRO 6000 Blackwell 是 NVIDIA 的專業工作站顯示卡,搭載 96GB ECC 顯存,用於大模型推論、微調與專業繪圖。團隊共用的情境下,顯存決定能放多大的模型與多少人的對話狀態,記憶體頻寬決定每個字吐得多快。

型號顯存記憶體頻寬功耗價格參考適用情境
RTX PRO 6000 工作站版96GB GDDR7 ECC1,792 GB/s600WNVIDIA 美國官方商城 US$16,000(2026-08)100B 級 MoE、同時掛多個模型
RTX PRO 6000 Max-Q 工作站版96GB GDDR7 ECC未於官方規格表列出300W[需確認報價]多卡工作站,控制散熱與電力
RTX PRO 6000 伺服器版96GB GDDR7 ECC1,597 GB/s400–600W[需確認報價]機架式多卡伺服器、需要 MIG 切分
RTX PRO 5000 72GB72GB GDDR7 ECC1,344 GB/s300W[需確認台灣報價]模型固定在 27B–35B 級、壓低成本與功耗

資料來源:功耗依 NVIDIA RTX PRO 6000 產品頁;PRO 5000 72GB 規格依麗臺官方產品頁;PRO 6000 頻寬依立方云引述 NVIDIA 官方頁面;價格依 XFastest,2026-08-13

NVIDIA 在 2025 年 12 月發表 72GB 版本時,把它定位在桌面端的代理式 AI 開發:

讓開發者在本地訓練、微調與原型開發更大的模型。

NVIDIA 官方部落格,2025 年 12 月 18 日(原文為英文,蓋斯克翻譯)

用〈大車拼〉的頻寬公式驗算一次:一個約 27GB 的 27B 8bit 模型,PRO 6000 的理論輸出上限約 1,792 ÷ 27 ≈ 66 tokens/s,PRO 5000 72GB 約 1,344 ÷ 27 ≈ 50 tokens/s。一位持有 PRO 6000 的社群用戶回報 Qwen 27B Q8 以 llama.cpp 實測 decode 約 44 tokens/s、prefill 約 1,600 tokens/s,達成率約三分之二,屬於合理範圍。

二、「吞吐量破千」和「每個人多快」是兩回事

總吞吐是所有請求加起來的產量,每個人等待的速度要用總吞吐除以同時處理的請求數;並發越高,總量越大、每人越慢。

一個好懂的比喻:一張顯示卡像一個收費站。收費站一小時能放行的總車數會隨著開放車道增加,看起來效率很高;每位駕駛在意的卻是自己排多久。車道越開越多,總通過量上升,每條車道分到的處理速度下降。規格表上的吞吐量是收費站的總通過量,使用者感受到的是自己那條車道。

單卡 RTX PRO 5000 72GB 並發數與總吞吐、每人速度對照圖|蓋斯克科技
單卡 RTX PRO 5000 72GB 跑 Qwen3.8-27B 的真實 Agent 流量:並發從 1 增加到 5,總吞吐從 58.6 升到 136.4 tokens/s,每人分到的速度從 58.6 降到約 27 tokens/s(社群實測,每人速度為蓋斯克換算)

目前最有參考價值的是李众力 2026-08-26 公開的數據:單卡 RTX PRO 5000 72GB、Qwen3.8-27B NVFP4 量化、vLLM、262K 上下文,服務十幾個全天候運作的 AI Agent。數據來自 vLLM 每 10 秒自動記錄的運行快照,使用 MTP3 投機解碼期間累積 13 天、51,711 筆,屬於真實流量,並非合成跑分。依並發分桶的中位數如下:

同時處理的請求數總吞吐(tokens/s)每人分到的速度(蓋斯克換算)
158.658.6
288.844.4
3120.440.1
4134.233.6
5136.427.3
6–8129.9約 16–22

資料來源:李众力,〈DFlash2 vs MTP3:單卡 27B 模型投機解碼實測〉,2026-08-26

並發到 4 以後總吞吐幾乎不再增加,代表這張卡的算力已經接近滿載,再多加使用者只會把同一份產量分得更細。另一組數據來自 2026-08-29 的社群整理:單張 PRO 6000 搭配 100GB 系統記憶體跑 Qwen3.8-Flash-Next 的量化方案,單並發約 76.4 tokens/s,32 並發總吞吐 491.8 tokens/s,換算每人約 15.36 tokens/s,整理者自己的評語是「已經快用不了了」。

多卡也是同樣的邏輯。一份 4 張 RTX PRO 5000 72GB 跑 DeepSeek-V4-Flash NVFP4 的評測顯示,4K 輸入在 16 並發時平均總吞吐約 179 tokens/s,換算每人約 11 tokens/s;20K 輸入的 Agent 任務適合 8–16 並發,40K 長上下文降到 4–8 並發,KV 快取成為主要限制。

看到吞吐數字,先驗算塞不塞得進去

社群有一篇文章宣稱單張 RTX PRO 6000 以 FP16 精度跑 80B 模型、吞吐近 1,000 tokens/s。80B 參數以 FP16 計算,每個參數 2 bytes,光權重就約 160GB,放不進 96GB 的顯存;原文也沒有寫明並發數。這類數字可能混用了量化版本或多卡環境,本篇不採用。用〈LLM 主機規格怎麼抓〉的公式先算權重大小,是過濾可疑數字最快的方法。

三、96GB 能放哪些模型?容量估算三步驟

先算權重,再算每個使用者的 KV 快取,最後保留運行餘量;MoE 模型的權重按總參數算,KV 快取由注意力層決定。

  1. 算權重:參數量乘以每個參數的位元組數。FP16 約 2 bytes、FP8 約 1 byte、INT4 約 0.5 byte。MoE 模型雖然每個 token 只啟用部分參數,全部權重仍要放進顯存。
  2. 算 KV 快取:KV 快取是模型為每段對話保存的中間狀態,會隨上下文長度與同時在線的人數線性增加。團隊共用時,這一項常常比權重更早把顯存吃完。
  3. 留運行餘量:CUDA 執行環境、框架工作區與啟動時的暫存都要空間,數字以推理框架的啟動日誌為準。

新一代混合注意力模型大幅降低了第二步的壓力。社群對 Qwen3.8-27B 架構的解析指出,它 64 層裡只有 16 層使用完整注意力,其餘 48 層改用只保留固定大小狀態的線性注意力,KV 快取約為同尺寸傳統模型的四分之一。另一篇社群實測量到每個 token 約 22KB,32K 上下文約 2GB。照這個數字粗估,10 個人各開 32K 上下文約需 20GB KV 快取,加上約 27GB 的 FP8 權重,一張 96GB 的卡還留有餘裕。這是容量上的估算,速度能不能讓 10 個人都滿意,要回到上一節的並發數據。

96GB能放哪些模型:容量檢查表|蓋斯克科技
96GB顯存能放哪些模型的容量檢查
模型權重大小(量化)單張 96GB單張 72GB說明
Qwen3.8-27BFP8 約 27GB;NVFP4 更小可以,KV 餘量充足可以,社群實測 NVFP4 開 262K 上下文目前團隊共用最常見的主力尺寸
GLM-4.5-Air(106B 總參數、約 12B 啟用)INT4 約 60–70GB可以,剩約 20–30GB 給 KV勉強,KV 餘量太少適合高品質、低並發
Qwen3.8-Flash-Next(125B 主模型+51B 嵌入參數)混合 NVFP4可以,需搭配約 100GB 系統記憶體卸載未見社群方案單卡方案仍在快速演進
Qwen3-235B-A22B官方 GPTQ-Int4 約 124.5GB不行,需 2 張不行兩張 96GB 張量並行,餘約 60GB 給 KV
DeepSeek-V4-Flash-0731(284B)NVFP4 約 176GB不行,需 2 張不行,社群評測用 4 張兩張 PRO 6000 張量並行是社群較完整的方案

資料來源:立方云,〈RTX PRO 6000 96GB 能部署哪些大模型〉,2026-09-08(其文中明言數字為容量規劃用途,非實測);error,2026-08-29

四、團隊共用該選 RTX PRO 6000 還是 PRO 5000 72GB?

模型固定在 27B–35B 級、要壓低成本與功耗時,PRO 5000 72GB 通常夠用;要放 100B 級 MoE、同時掛多個模型,或需要更多 KV 空間服務長上下文,才需要 96GB。

價格是這一年最大的變數。XFastest 2026 年 8 月 13 日報導,PRO 6000 工作站版在 NVIDIA 美國官方商城的標價從首發約 US$8,565、6 月的 US$13,250,調到 8 月的 US$16,000。知乎上一位通路相關回答者提到,PRO 6000 的中國渠道價半個月內從含稅約 7.5 萬漲到 11.5 萬人民幣,同時觀察到 PRO 5000 72GB「便宜好多」;另一位供應高校課題組的回答者也判斷,後續可能有人轉用 PRO 5000。台灣報價波動大,下單前務必取得當期書面報價。

比較維度RTX PRO 6000(96GB)RTX PRO 5000(72GB)適用情境
理論輸出速度(27B 8bit)約 66 tokens/s約 50 tokens/s每人速度敏感的互動式使用,PRO 6000 較有餘裕
可放的模型上限106B 級 MoE INT435B 級較從容要跑 100B 級模型只能選 96GB
功耗與散熱工作站版 600W300W一台機器插多張卡、辦公室環境,PRO 5000 較好處理
價格走勢2026 年大幅上漲社群回報相對便宜預算固定、只跑 27B 級模型時,PRO 5000 CP 值較高
MIG 切分伺服器版支援最多切 2 個 36GB 實例要把一張卡隔離給不同部門使用時

想知道你的環境適不適合導入 AI?

LINE 傳訊描述你的設備規模,免費給你初步可行性評估,不用先約不用先付錢。

LINE 詢問 AI 導入 → 預約免費健診

五、讓一張卡服務多人的五個設定

用 vLLM 或 SGLang 提供服務,加上 API 閘道、FP8 KV 快取、前綴快取、投機解碼與 CUDA Graph,同一張卡的表現可以差上好幾倍。

軟體設定的影響有多大,社群一組兩張 PRO 6000 跑 DeepSeek-V4-Flash-0731 的調校紀錄可以說明:未最佳化的 eager 模式只有 17.8 tokens/s,開啟 CUDA Graph 後到 77.1,再經過核心調校、投機解碼與 MoE 核心替換,最後到 202.7 tokens/s,同樣的硬體相差超過 11 倍。

軟體調校讓RTX PRO 6000快11倍|蓋斯克科技
軟體調校讓同一張卡快11倍:從17.8到202.7 tokens/s
設定做什麼效果與代價適用情境
vLLM 服務化加 API 閘道提供 OpenAI 相容 API,閘道負責帳號、配額與用量統計團隊成員用現有 SDK 直接串接;社群常見搭配是 New-API 閘道所有多人共用情境
FP8 KV 快取vLLM 的 --kv-cache-dtype fp8KV 快取占用約減半,可服務更多人或更長上下文;極端情況的精度影響需自行評估長上下文、多人同時在線
前綴快取系統指令與工具定義相同的請求,重用已算好的結果社群實測在 Agent 場景提速明顯,幾乎沒有代價Agent、共用同一套系統提示詞的團隊
投機解碼草稿模型或 MTP 頭先猜多個 token,主模型一次驗證單卡 27B 實測中,DFlash2 在單一請求時達 MTP3 的 3.13 倍,並發升高後兩者趨近低並發、每人速度優先
保留 CUDA Graph不要為了除錯開 --enforce-eager社群一組 4 卡叢集只拿掉這個參數,每 token 延遲從 131ms 降到 32ms所有生產環境

資料來源:立方云,2026-09-08李众力,2026-08-26卡卡带我飞,2026pine,2026-04-16(API 閘道做法)

投機解碼那一列值得多看一眼。李众力的數據裡,DFlash2 在並發 1 時把速度從 58.6 拉到 183.1 tokens/s,並發 3 到 4 時只剩一成左右的提升。原因是低並發時瓶頸在逐字解碼,投機解碼正好解決它;並發一高,瓶頸移到整張卡的算力總量,猜得再準也沒有多餘算力可用。團隊人數少、每人要快,投機解碼最划算;人數多,要靠加卡。Ollama 與 vLLM 在多人情境的完整差異,見〈Ollama 可以上企業生產環境嗎〉。

六、一張卡不夠時,擴充到兩張、四張要注意什麼?

RTX PRO 6000 沒有 NVLink,多卡之間走 PCIe 5.0 x16,張量並行的通訊開銷會吃掉一部分效能;四張 72GB 也不等於一塊連續的 288GB。

立方云提醒,NVIDIA 官方規格頁列出的系統介面是 PCIe 5.0 x16,沒有 NVLink 選項,卡間通訊都走 PCIe。4 張 PRO 5000 72GB 的評測作者也特別註明,每張卡的記憶體彼此獨立,張量並行分配與每張卡各自的快取需求,會讓有效容量低於四張相加。

什麼時候值得擴到四張?一個遊戲研發團隊 2026-08-31 分享的選型歷程很有參考價值。他們從小模型逐步驗證:7B 能生成程式碼但扛不住複雜 Agent 提示;32B 開始具備 Agent 形態,卻容易只規劃不動手;72B 稠密模型能力明顯提升,但 16K–32K 的上下文很快被專案規則與日誌塞滿。最後用 4 張 PRO 6000 部署 DeepSeek-V4-Flash,提供 256K 服務上下文、約 133 tokens/s,才接近他們要的「團隊級本地主腦」。他們的心得是:參數量決定能力門檻,上下文決定 Agent 能不能持續工作。

多卡伺服器通常放進機房長時間運轉,網段隔離與存取控制要一起規劃,做法見〈AI 防火牆怎麼建置〉;整體建置流程與地端、雲端的成本比較,見〈地端 LLM 建置完整指南〉。

七、蓋斯克怎麼評估

蓋斯克科技目前沒有 RTX PRO 6000 或 PRO 5000 72GB 的自有壓測數據,本篇數字都來自上方註明的社群公開資料與原廠規格。[需提供蓋斯克實測或客戶導入案例:卡型與張數、模型與量化、實際使用人數、每人速度與尖峰並發、導入前後的變化。若暫無,發佈時可刪除本節。]

結論:先定每人要多快,再算要幾張卡

單卡 LLM 伺服器三大重點結論字卡|蓋斯克科技
  • 吞吐要換算成每人速度:社群真實流量中,單卡並發到 4–5 後總吞吐就接近上限,再多人只是把同一份產量分得更細。
  • 容量先驗算:權重、KV 快取、運行餘量三步算完,27B 級混合注意力模型是目前單卡服務多人最實際的選擇。
  • 軟體設定優先於加卡:CUDA Graph、FP8 KV 快取、前綴快取與投機解碼,同一張卡能差上數倍,採購前用團隊真實工作量壓測。

立即開始:你的團隊 LLM 伺服器值得一次算清楚

蓋斯克科技協助台灣中小企業評估地端 AI 基礎建設,從單機開發環境到多人共用的生產架構,依實際使用情境給建議,不先推銷特定機種。

我們提供:

  • 依使用人數、常用模型與上下文長度,估算需要的顯存與卡數
  • 2026 年顯示卡市場報價區間,避免用過時價格做預算
  • 透明報價,無隱藏費用
  • 設備租賃與採購兩種路線並陳,先用真實工作量壓測再決定

顯示卡一路漲價,想先租來壓測再決定要不要買?

蓋斯克科技提供企業設備租賃與地端 AI 導入評估服務,先確認需求規模,再決定要不要投資硬體。

了解設備租賃方案 免費預約諮詢

電話:02-2717-1019 LINE:@zonetech

關於作者

Gask Hung|蓋斯克科技創辦人,專注台灣中小企業 IT:企業 Wi-Fi、4K 剪輯系統、IT 委外與設備租賃,近期投入地端 LLM 導入評估。完整作者介紹

延伸閱讀:地端 LLM 主機大車拼Mac Studio M5 跑地端 LLM 實測整理設備租賃服務

更多關於 RTX PRO 6000 團隊共用的常見問題FAQ

Q1:一張 RTX PRO 6000 可以給幾個人用?

沒有固定答案,要看模型、上下文長度與每人可接受的速度。社群真實流量中,單卡 27B 模型並發到 4–5 時總吞吐接近上限,每人約 27–34 tokens/s;並發到 32 時每人只剩約 15 tokens/s。建議用團隊實際工作量壓測決定。

Q2:RTX PRO 5000 72GB 夠用嗎?

模型固定在 27B–35B 級時通常夠用。社群已有單卡 PRO 5000 72GB 跑 Qwen3.8-27B、262K 上下文服務十幾個 Agent 的實例。要放 100B 級 MoE 或同時掛多個模型,才需要 96GB。

Q3:RTX 5090 32GB 可以拿來給團隊共用嗎?

小團隊可以試,但容量很緊。27B 模型 FP8 權重約 27GB,放進 32GB 後留給多人 KV 快取的空間很少。頻寬與 PRO 6000 相同,瓶頸落在同時能服務的人數與上下文長度。

Q4:團隊共用要用 vLLM 還是 Ollama?

多人共用建議用 vLLM 或 SGLang。它們有連續批次處理與分頁式 KV 快取管理,搭配 API 閘道能管理帳號與配額。Ollama 適合個人或概念驗證,多人同時請求時容易成為瓶頸。

Q5:買一張 PRO 6000,還是多張 RTX 5090?

看模型大小與並發型態。社群一組 230B 模型測試中,單張 PRO 6000 與四張 5090 的單序列速度幾乎打平,功耗 600W 對約 2,300W;多人同時請求時,多卡可分流而總吞吐較高。模型放得進單卡就優先單卡。

Q6:顯示卡一直漲價,該買還是先租?

還不確定團隊實際用量時,建議先租賃壓測。PRO 6000 美國官方價一年半漲近九成,模型也在快速變小變強,先用真實工作量確認需要幾張、哪一型,再決定採購,比一次到位風險低。

蓋斯克科技

企業級網路規劃
電話:02-27171019
商家:https://g.page/zonetech-tw
地址:10491臺北市中山區建國北路二段125號4樓

分享至Facebook

精選文章

📍 服務地區

台北辦公室網路規劃 新北企業資訊委外 台北IT委外服務 新北網路建置規劃 台北設備租賃 新北設備租賃