LLM 主機規格怎麼抓?模型參數 × VRAM × 顯卡 × 台幣預算對照表(2026)
發布:2026-08-06|最後更新:2026-08-06
多數人抓 LLM 主機規格的方法是「看別人買什麼卡就跟著買」,結果不是 VRAM 不夠、跑到一半就 OOM 當機,就是花大錢買了用不到的算力。硬體規格不是照模型參數量的大小去猜,而是先把量化後的實際 VRAM 需求算出來,再對應到消費級、工作站級或資料中心級三種硬體類型。這篇文章把換算公式、五級對照表、量化格式差異一次講清楚,不管你要跑 Qwen、DeepSeek 還是 MiniMax,看完就知道自己該抓多大的主機、抓什麼等級的顯卡。
本文重點摘要
- VRAM 需求公式:參數量(B)× 每參數位元組數,70B 模型 FP16 約需 140GB、Q4 量化約需 40GB
- 五個模型級距(7B/14B/32B/70B/百 B 級 MoE)對應消費級、工作站級、資料中心級三種硬體
- MoE 模型最常見誤解:規劃硬體要看「總參數量」,不能只看「激活參數」
- 128GB 統一記憶體平台(如 DGX Spark)與傳統獨立 VRAM 架構是兩種不同取捨,沒有絕對優劣
適合閱讀對象
評估地端 LLM 主機採購規格的 IT 主管、想知道自己的模型該配多大顯卡的開發者、在租賃與採購間抓預算的企業決策者
想知道你要跑的模型該配多大的 VRAM?加 LINE 傳你想跑的模型名稱與使用人數規模,我們先幫你抓規格 → 加 LINE 諮詢
一、VRAM 需求怎麼算:參數量 × 量化格式的白話公式
VRAM 需求的核心公式是「參數量(B)× 每參數位元組數 × 1.2 左右的緩衝」,同一顆模型換不同量化格式,VRAM 需求可以差到三、四倍。VRAM 需求估算是把模型參數量換算成實際佔用顯示記憶體大小的計算方式,用於在採購或部署前先確認硬體夠不夠用。
一個好懂的比喻:模型參數就像倉庫裡要上架的一箱箱貨物,量化格式決定每箱貨物包裝後的體積——FP16 是原箱不拆,體積最大;Q4 量化像是把貨物做真空壓縮,體積縮到約四分之一,但要多一道壓縮/解壓縮的工。倉庫(VRAM)不只要放下所有箱子,還要留一塊工作台空間給搬運作業(推理時的 KV cache 與 context 暫存),這也是為什麼實際需求會比帳面數字再多抓 20–30% 緩衝的原因。
| 精度格式 | 每參數位元組數(概算) | 7B 模型概算 | 70B 模型概算 |
|---|---|---|---|
| FP32 | 4 bytes | ≈ 28GB | ≈ 280GB |
| FP16/BF16 | 2 bytes | ≈ 14GB | ≈ 140GB |
| FP8 | 1 byte | ≈ 7GB | ≈ 70GB |
| Q4/INT4 量化 | 約 0.5 byte | ≈ 3.5–5GB | ≈ 35–40GB |
上面是模型權重本身的概算,實際部署還要疊加 KV cache(隨 context 長度增加而變大)與推理框架本身的記憶體開銷。正式規劃硬體規格時,建議在權重需求之外,再預留 20–30% 的緩衝空間,避免長對話或多人併發時把 VRAM 用滿導致 OOM(記憶體不足當機)。
二、7B/14B/32B/70B/百 B 級 MoE 五級對照大表
模型規模每跳一級,建議硬體大致跟著從消費級顯卡跳到工作站級,再跳到資料中心級,百 B 級 MoE 模型是例外——它考驗的是總記憶體容量,不是算力。下表把常見的五個模型級距,對應到建議 VRAM、建議硬體類型與適合場景,是選購前最快的判斷依據。
| 模型級距 | FP16 建議 VRAM | Q4 量化建議 VRAM | 建議硬體類型 | 適合場景 |
|---|---|---|---|---|
| 7B 級 | ≈ 14GB | ≈ 5GB | 消費級(8–12GB 顯卡) | 個人開發測試、輕量客服機器人 PoC |
| 14B 級 | ≈ 28GB | ≈ 9–10GB | 消費級/工作站入門(16–24GB) | 小團隊程式助理、內部文件問答系統 |
| 32B 級 | ≈ 64GB | ≈ 18–20GB | 工作站級(24–48GB,單卡或雙卡) | 部門級中文 RAG、客服系統知識庫 |
| 70B 級 | ≈ 140GB | ≈ 40GB | 工作站級多卡或 128GB 統一記憶體平台 | 企業級複雜推理、多輪長對話應用 |
| 百 B 級 MoE | 依「總參數量」而非激活參數估算 | 資料中心級多卡叢集或大容量統一記憶體 | 高併發生產環境、多模型混合部署 | |
百 B 級 MoE(混合專家架構)模型比較特別:以 DeepSeek V4-Flash 為例,這顆模型於 2026 年 4 月由 DeepSeek 官方發布,採 MIT 授權,總參數規模 284B,但推理時只會啟動其中約 13B 的「激活參數」進行運算。如果只看「13B」就以為用一般 32B 等級的工作站規格就夠,會踩到大坑——完整 284B 的模型權重仍然要能全部載入記憶體,硬體規劃必須以總參數量為準,詳見後段〈常見選錯規格的坑〉。中國開源模型家族的完整版本、規模與授權比較,可參考《中國開源大模型全盤點》。

三、量化格式差在哪:FP16/FP8/NVFP4/GPTQ-Int4
量化格式決定同一顆模型能塞進多小的 VRAM、要付出多少精度代價,格式選擇要看硬體是否原生支援,不是位元數愈低愈好。以下是目前地端部署最常遇到的四種格式,精度與相容性各有取捨。
| 格式 | 每參數位元組(概算) | 精度與相容性權衡 | 常見場景 |
|---|---|---|---|
| FP16/BF16 | 2 bytes | 業界訓練與部分推理的標準精度,精度最完整但吃最大 VRAM | 對精度要求高、VRAM 充裕的場景 |
| FP8 | 1 byte | 新一代 GPU(如 Hopper/Blackwell 世代)原生支援的 8 位元浮點,精度損失通常可接受,推理速度提升明顯 | 工作站級以上、硬體支援 FP8 加速的部署 |
| NVFP4 | 約 0.5 byte | Nvidia Blackwell 世代原生支援的 4 位元浮點格式,是目前官方支援中最省 VRAM 的格式之一 | 128GB 統一記憶體平台等 Blackwell 世代硬體 |
| GPTQ-Int4/AWQ-Int4 | 約 0.5 byte | 社群常用的訓練後量化(PTQ)方法,把權重量化到 4 位元整數,需搭配對應推理框架支援,兼容性較廣但需額外校準流程 | 需要在較舊世代硬體上跑大模型的情境 |
以 MiniMax M2.5 為例,這顆模型於 2026 年 2 月由 MiniMax 官方發布,屬於標準 MIT 授權、可自由商用,官方同時提供 NVFP4 量化版本,能大幅降低記憶體佔用,同時維持標準 MIT 的商用彈性。完整部署教學與授權注意事項(M2.5 可商用、M2.7 需書面授權)可參考《MiniMax 地端部署與授權地雷》。挑選量化格式時,先確認你的硬體世代與推理框架(如 vLLM、SGLang)是否原生支援該格式,比追求「位元數愈低愈好」更重要——不相容的量化版本,就算檔案下載得下來,也不一定能順利載入推理。
四、統一記憶體 vs 獨立 VRAM:架構怎麼選
統一記憶體用大容量換取能跑更大的模型,獨立 VRAM 用高頻寬換取更快的單一模型推理速度,兩種架構沒有絕對優劣,要看你是想「跑得大」還是「跑得快」。
以 DGX Spark 為例,這是目前市面上具代表性的 128GB 統一記憶體平台,搭載 GB10 Grace Blackwell 超級晶片,機身僅 1.1 公升,推理功耗約 38W。
NVIDIA 官方產品規格指出,DGX Spark 搭載 GB10 Grace Blackwell 超級晶片與 128GB 統一記憶體,記憶體頻寬達 273GB/s,最大可支援微調 700 億參數規模的模型。
傳統獨立 VRAM 架構(如一般 RTX 系列工作站顯卡)則是另一條路線:GPU 有自己專屬的顯示記憶體,透過 PCIe 與系統記憶體分離,顯存頻寬通常遠高於統一記憶體平台,但容量受限於單卡標配,要跑更大的模型就得靠多卡並聯,此時卡間互連頻寬又會成為新的瓶頸。這也是「273GB/s 頻寬夠不夠」在社群上常有爭議的原因——頻寬確實不是獨立高階顯卡的等級,但换來的是能單機塞下 70B 級模型,不用組多卡叢集。根據 2026 年社群基準測試(非蓋斯克自測,Strix Halo 對照組數據),AMD Strix Halo 128GB 平台的 token 生成速度約 73 t/s,與 DGX Spark 約 84 t/s 相近,但兩者在 prompt processing(提示詞處理)階段差距明顯,達到 342 對 2,107 t/s,接近 6 倍差距——這說明統一記憶體平台的頻寬瓶頸,在長輸入、大批量處理的場景會比短對話更明顯。
蓋斯克科技目前已導入 DGX Spark 進行地端部署評估與測試,協助台灣中小企業在導入地端 LLM 前,先確認硬體規格是否符合實際模型需求,避免規格買錯或買貴。完整的地端 LLM 建置流程與決策框架,可參考《地端 LLM 建置完整指南》。
五、各預算帶的路線建議:入門、中階、進階
入門用消費級顯卡驗證需求、中階上 128GB 統一記憶體平台、進階才考慮多卡工作站或機房級部署,三個階段對應的是驗證規模、不是預算大小本身。
| 路線 | 建議規模 | 硬體參考(僅公開市價,服務費另計) | 適合對象 |
|---|---|---|---|
| 入門 | 7B–14B 級模型 POC 驗證 | 消費級顯卡(二手或新品,價格依市場浮動,下單前建議查詢當下牌價) | 個人開發者、想先驗證模型能不能用的團隊 |
| 中階 | 32B–70B 級模型正式導入 | 128GB 統一記憶體平台,如 DGX Spark 台灣通路(2026 年 8 月,依容量)約 NT$164,850–239,900;華碩 Ascent GX10 市價(2026 年 8 月,依容量)約 NT$165,900–245,900 | 中小企業部門級部署、需要跑到 70B 級但不想組多卡叢集 |
| 進階 | 百 B 級 MoE、多人高併發生產環境 | 多卡工作站或機房級部署,硬體與機房建置成本需依現場規模報價 | 需要穩定支撐多人同時使用的正式生產系統 |
需要特別留意的是,DGX Spark 上市時官方建議價為 US$3,999,但 2026 年 3 月已調漲約 17.5% 至 US$4,699,網路上不少舊資料仍停留在原價,實際採購前務必核對當下報價再決定。台灣通路含麗臺版、創始版,PChome 24h、momo、原價屋、機器人王國等通路均有現貨;華碩 Ascent GX10 上市建議價為 NT$97,900 起,但這是建議價不是市價,2026 年 8 月的實際市場價格明顯高於建議價,兩者要分開看。
六、常見選錯規格的坑
最常見的規格坑不是「買太小」,而是漏算了 KV cache、context 長度、MoE 總參數量這些不會寫在模型名稱上的隱藏需求。下表整理五個最容易踩的坑。
| 症狀 | 常見原因 | 解決方向 | 蓋斯克怎麼做 |
|---|---|---|---|
| 模型載入到一半就 OOM 當機 | 只算了模型權重,沒算 KV cache 與 context 暫存的額外開銷 | 預留 20–30% VRAM 緩衝,或降低 context 長度/量化等級 | 現場評估實際使用情境,建議合理緩衝空間 |
| 買了小 VRAM 機器,結果 MoE 模型權重根本放不進去 | 只看「激活參數」,沒看模型的「總參數量」 | MoE 模型要用總參數量對應的記憶體需求規劃硬體,不是激活參數 | 導入前先核對模型完整權重大小 |
| 同樣是「70B」模型,別人的機器能跑,自己的卻 OOM | 量化格式不同(FP16 vs Q4)、context 長度設定不同 | 確認對方實際使用的量化格式與 context 設定,不能只看模型代號 | 提供量化方案評估與規格試算 |
| 多卡買了卻沒有比單卡快多少 | 卡間互連頻寬不足,模型層切分帶來的通訊開銷抵銷了算力提升 | 選擇有高速互連的多卡平台,或改用統一記憶體單機方案 | 依併發規模建議合適架構 |
| 顯卡驅動與框架版本對不上量化格式 | NVFP4 等新格式需要對應世代 GPU 與最新驅動/框架支援 | 採購前確認推理框架(如 vLLM、SGLang)版本相容性 | 代客確認硬體與框架相容性 |
其中最容易被忽略的是 MoE 模型的規格誤解。Qwen3.6-35B-A3B 是另一個典型例子,這顆模型於 2026 年 4 月由 Qwen 官方發布,採 Apache 2.0 授權——從命名方式就能看出線索:35B 是總參數規模,「A3B」代表推理時實際啟動的激活參數約落在 3B 等級,但硬體規劃仍要以完整 35B 的權重大小為準,不能因為「激活參數只有 3B」就配置成 7B 級模型的規格。Qwen 系列完整的部署教學可參考《Qwen 地端部署完整教學》,DeepSeek 的部署與資安考量則可參考《DeepSeek 地端部署與資安指南》。
七、租賃還是採購:地端 LLM 主機怎麼選最划算
短期驗證或規模還在變動的團隊適合先租賃,長期穩定高使用率的正式生產環境才適合採購,兩者都可以先從免費評估開始。
採購的優點是長期使用下來單位成本較低,設備完全自主可控;缺點是要一次付出較高的前期投資,而且 GPU 硬體世代更新快,過幾年可能面臨規格落後的問題。租賃的優點是前期成本低、可以隨模型規模調整設備等級,適合還在驗證「這顆模型到底適不適合我們」的階段;缺點是長期租賃的總成本可能高於一次採購。實務上,多數中小企業會先用租賃或雲端方案驗證需求,等確定模型規模與使用量穩定之後,再評估是否轉為採購,這樣可以避免規格一次買錯就要重新來過。
立即開始:你的 LLM 主機規格值得一次抓對
蓋斯克科技提供 GPU 主機租賃與地端 LLM 建置評估服務,協助台灣中小企業依實際模型需求規劃合適硬體規格,避免規格買錯或買貴。
我們提供:
- 依你要跑的模型規模與併發人數,量身建議硬體規格與量化方案
- GPU 主機租賃方案,適合驗證階段或規模會變動的團隊
- 透明報價,服務費一律依需求現場評估,無隱藏費用
- 導入後的規格調整與維護建議,不是賣完設備就結束
還在猶豫該租還是該買,或不確定自己的模型該配多大規格?
蓋斯克科技持有 UniFi 認證,為 QNAP、MOXA 原廠授權服務中心,專注台灣中小企業 IT 建置與設備租賃,服務費用一律依現場需求報價。
查看 GPU 主機租賃方案 免費預約諮詢電話:02-2717-1019 LINE:@zonetech
關於作者
Gask Hung|蓋斯克科技負責人,專注台灣中小企業 IT:企業 Wi-Fi、4K 剪輯系統、IT 委外與設備租賃,近期投入地端 LLM 主機建置評估。完整作者介紹
延伸閱讀:地端 LLM 建置完整指南|中國開源大模型全盤點|GPU 主機租賃
更多關於LLM主機規格的常見問題FAQ
Q1:地端跑 LLM 一定要買到 128GB VRAM 的機器嗎?
不一定。地端 LLM 主機規格要看你要跑的模型規模,不是硬體愈大愈好——7B、14B 級模型消費級顯卡就能跑,128GB 統一記憶體平台主要是為了 70B 以上或多模型併發的場景,先確認模型需求再抓硬體才不會多花冤枉錢。
Q2:跑 7B、14B、70B 模型分別要多少 VRAM?
概算(FP16/Q4 量化):7B 約需 14GB/5GB,14B 約需 28GB/9–10GB,70B 約需 140GB/40GB。實際部署還要加上 KV cache 與 context 暫存,建議再抓 20–30% 緩衝空間。
Q3:量化會不會嚴重影響模型效果?
量化會有一定精度損失,但主流的 Q4/INT4、FP8、NVFP4 格式在多數企業應用(客服、文件問答、程式輔助)上影響通常有限,關鍵是選擇有官方或框架原生支援的量化方法,避免用未經驗證的量化版本。
Q4:二手顯卡能不能拿來跑 LLM?
可以,但要注意兩件事:一是 VRAM 容量是否符合你要跑的模型級距,二是顯卡世代是否支援你要用的量化格式(如 NVFP4 需要較新世代 GPU)。二手顯卡是入門級最常見的省錢做法,採購前建議先確認保固與實際可用容量。
Q5:統一記憶體跟獨立 VRAM 顯卡,哪個比較適合我?
看你的使用情境。統一記憶體平台(如 128GB 機種)適合想跑較大模型、但預算或空間有限的團隊;傳統獨立 VRAM 架構頻寬通常更高,適合追求單一模型極速反應的場景。兩者沒有絕對優劣,取決於你要「跑得大」還是「跑得快」。
Q6:預算有限,應該先買小規格還是先租?
預算有限時,建議先用消費級顯卡或租賃方案驗證模型是否符合需求(POC 階段),等確定規模與使用量之後,再決定是否採購中階或進階設備。地端建置前先做小規模驗證,比一次到位採購風險更低。
Q7:MoE 模型是不是比較省硬體?
這是常見誤解。MoE 模型推理時只會啟動部分「激活參數」運算,但完整權重仍要全部載入記憶體——例如 DeepSeek V4-Flash 總參數 284B、激活 13B,規劃硬體時要看 284B 對應的記憶體需求,不能只看激活參數。
Q8:DGX Spark 這類統一記憶體主機最大可以跑到多大的模型?
以 128GB 統一記憶體平台(如 DGX Spark)為例,官方規格顯示最大可支援微調到 70B 參數規模的模型;若只做推理(不微調),搭配量化格式通常還能再往上跑到更大的模型級距,實際上限依模型架構與量化方式而異。





