地端 LLM 建置完整指南:企業自建 AI 的硬體、模型、費用與資安(2026)
發布:2026-08-06|最後更新:2026-08-06
地端 LLM 建置的關鍵有三件事:(1)先抓對規模,小型驗證用單機起步,全公司生產才上多卡或機房級;(2)模型選對授權,中國開源模型軍團品質已追上主流,但 Apache 2.0、MIT 與需簽署授權的模型不能混為一談;(3)部署框架跟著用途走,概念驗證用 Ollama、多人生產環境上 vLLM 或 SGLang。資料不能出門、雲端帳單壓不住,是中小企業評估自建地端 LLM 最常見的兩個理由,但地端不是萬靈丹,硬體與服務費用需要依現場規模評估,沒有一套公版報價適用所有公司。本文整理 2026 年 8 月最新的硬體市價、開源模型授權與建置流程 SOP,供正在評估地端 LLM 的企業參考。
本文重點摘要
- 地端 LLM 主機價位分三個量級:小型單機路線硬體約 NT$16-24 萬起(DGX Spark/華碩 Ascent GX10 級距,2026 年 8 月市價),中型多卡工作站與大型機房級需依配置報價。
- 2026 年可地端商用的開源模型以中國模型軍團為主力:Qwen、DeepSeek、GLM(5.1 起)、Hunyuan(07-06 正式版起)、InternLM、MiniMax M2.5 都是完全自由商用授權,但 MiniMax M2.7 與 Kimi K3 需先核對授權條文。
- 部署框架先用 Ollama 做概念驗證,多人生產環境再上 vLLM 或 SGLang,兩者定位不同,不是二選一的競品。
- 地端不等於自動安全,主機仍需要獨立網段、防火牆規則與存取控管,才算完整的資安建置。
適合閱讀對象
正在評估要不要自建 AI 主機的中小企業主、擔心資料外洩想找雲端替代方案的 IT 主管、想先用小規模測試地端 LLM 可行性的技術負責人
想知道你的公司規模適合哪種地端 LLM 路線?加 LINE 傳你的使用情境與人數,我們先幫你初步判斷 → 加 LINE 諮詢
一、為什麼 2026 年中小企業開始自建地端 LLM?
資料不能出門、雲端帳單壓不住,加上開源模型品質追上主流,是 2026 年中小企業開始評估地端 LLM 的三個直接原因。AI 基礎建設的整體趨勢,蓋斯克科技在GMI Cloud 與台灣 AI 工廠布局與NVIDIA GTC 2026 AI 基礎建設兩篇文章已經完整說明,本文不重複,直接聚焦「企業自己該怎麼建」這件事:多少錢、選哪個模型、怎麼部署、怎麼驗收。
二、地端 vs 雲端 API vs 雲端託管:三路線該怎麼選?
三條路線的本質差異不是「貴不貴」,而是成本結構長什麼樣:地端是前期硬體投資、雲端 API 是隨用量計費、雲端託管 GPU 是固定時段租金。把這三種結構搞清楚,比直接比較數字更重要,因為適合的路線會隨用量規模、資料敏感度而改變。
一個好懂的比喻:地端像買房自住,雲端 API 像每次叫車,雲端託管 GPU 像長租一輛車。買房前期要付一大筆錢,之後住多久都不再多收費;叫車不用先付錢,但坐越多趟、月底帳單就越可觀;長租車介於兩者之間,固定月租金,用量再大也不會超收,但不用不退費。
| 決策面向 | 地端 LLM | 雲端 API | 雲端託管 GPU |
|---|---|---|---|
| 初期成本 | 高(硬體一次性投入,見下節) | 幾乎為零 | 低(依租用方案) |
| 月費模式 | 邊際成本趨近電費與維運,用量不影響月費 | 依 token 用量計費,用量越大月費越沒有上限 | 固定時數/月租費用,持續使用會隨時間累積 |
| 資料主權 | 資料留在自有機房,不出門 | 資料需傳送到供應商伺服器 | 資料留在租用的雲端環境,仍受供應商條款約束 |
| 彈性擴張 | 擴充需採購硬體,時間較長 | 用量隨時可調整,最有彈性 | 可依方案調整規格,彈性介於兩者之間 |
| 維運責任 | 企業自行維運(或委外) | 供應商負責 | 供應商負責底層,企業管理應用層 |
| 適用情境 | 資料敏感、長期高頻使用、想控制長期總成本 | 用量不穩定、還在驗證階段、不想管硬體 | 需要 GPU 但不想一次性採購,用量中期可預期 |
確切的雲端 API 或雲端託管月費因供應商、方案與用量差異極大,本文不列出具體金額,只比較三條路線的成本結構量級差異,實際費用請以當下供應商報價為準。資料主權與雲端儲存方案的取捨,也可以參考蓋斯克科技整理的企業雲端儲存方案比較。
三、地端 LLM 主機要多少錢?三種規模路線一次看懂
地端 LLM 主機分三個量級:小型單機路線硬體約 NT$16-24 萬起(2026 年 8 月市價),中型多卡工作站與大型機房級沒有公版報價,只能依實際配置估算。先確定自己屬於哪個量級,再談預算,比先問「多少錢」更有效率。
小型路線:DGX Spark 與華碩 Ascent GX10
根據 NVIDIA 與代理商麗臺科技(2465)資料,DGX Spark 搭載 GB10 Grace Blackwell 超級晶片與 128GB 統一記憶體,官方售價已於 2026 年 3 月由 US$3,999 調漲至 US$4,699(漲幅 17.5%);台灣通路方面,2026 年 8 月 BigGo 比價網資料顯示,麗臺版依容量約 NT$164,850–239,900、創始版約 NT$199,900,PChome 24h、momo、原價屋、機器人王國等通路皆有現貨。同級的華碩 Ascent GX10 上市建議價為 NT$97,900 起,但 2026 年 8 月現行市價已上升至 1TB 版約 NT$165,900–182,900、4TB 版約 NT$225,900–245,900,建議價與市價落差不小,估算預算時要用市價而非上市建議價。
| 項目 | DGX Spark | 華碩 Ascent GX10 |
|---|---|---|
| 官方售價 | US$4,699(2026/3 調漲後) | 上市建議價 NT$97,900 起 |
| 台灣現行市價(2026-08) | 麗臺版約 NT$164,850–239,900;創始版約 NT$199,900 | 1TB 版約 NT$165,900–182,900;4TB 版約 NT$225,900–245,900 |
| 核心規格 | GB10 Grace Blackwell 超級晶片、128GB 統一記憶體、273GB/s 頻寬、1 PFLOP(FP4) | 同屬 GB10 平台級距(依版本容量而異) |
| 機身與功耗 | 1.1 公升、推理功耗約 38W | 依機型而異 |
| 適用情境 | 單人開發、小規模模型驗證,可微調最大 70B 參數模型 | 同屬小型驗證路線,容量選擇更多元 |
社群實測顯示,DGX Spark 單台可執行 Qwen3.6-35B-A3B(NVFP4 量化版,256K context),推論速度約 110 tokens/秒;由於官方僅支援兩台原生互連,兩台叢集可執行 DeepSeek V4-Flash(284B,1M context),速度約 40-45 tokens/秒,單台以 vLLM 服務可支援 64 位使用者、速度 700+ tokens/秒、功耗約 38W。這些數字來自社群公開實測,並非蓋斯克自行測試的結果,實際表現會依模型、量化格式與併發量而不同。作為對照,AMD Strix Halo 128GB(約 US$2,000)在 token 生成速度上與 DGX Spark 接近(73 t/s 對 84 t/s),但 prompt processing 速度慢約 6 倍(342 對 2,107 t/s),這是統一記憶體頻寬瓶頸的典型案例,也是選購前該弄清楚的「規格陷阱」。
中型與大型路線:沒有公版數字,只有量級描述
中型路線是多卡工作站,由多張消費級或專業級顯卡組成,沒有固定台幣公版報價,需依顯卡數量、記憶體與整合服務估算,一般是「單一部門長期生產使用」的量級。大型路線是機房級 GPU 叢集,涉及機房空間、供電與網路架構規劃,屬於「全公司多部門、高併發生產」的量級,費用需要現場評估,同樣沒有公版數字。更細的 VRAM 需求與顯卡選擇對照,可參考LLM 主機規格對照表;大型機房級路線涉及的機櫃佈線與供電規劃,可參考機房線路管理指南與企業弱電工程指南。若還不確定要不要一次性採購,也可以先用租賃模式驗證,蓋斯克科技的設備租賃服務是常見的先期測試替代方案。

四、2026 該選哪個開源模型?中國開源模型軍團授權紅綠燈
2026 年可地端商用的主力機型幾乎都來自中國開源陣營,但授權條款差異很大:Apache 2.0 與 MIT 可以直接商用,MiniMax M2.7 與 Kimi K3 則需要額外確認授權條文。選模型不能只看跑分或參數量,授權踩錯比效能不夠更麻煩。
| 家族 | 最新可地端部署版本 | 規模 | 授權 | 備註/地雷 |
|---|---|---|---|---|
| Qwen(阿里) | Qwen3.5(2026-02-16,九尺寸 0.8B–397B-A17B)、Qwen3.6-35B-A3B(04-16)、Qwen3.6-27B dense(04-22) | 0.8B–397B | Apache 2.0 | Qwen3.7-Max(05-19)是 API-only 不開源,不可寫成可地端部署選項 |
| DeepSeek | V4-Pro(1.6T/49B 激活)、V4-Flash(284B/13B 激活),2026-04-24 發布,07-31 公測更新 | 284B–1.6T | MIT | R1 世代已汰除,舊版 API 已下架,不要再找 R1 教學 |
| MiniMax | M2.5(2026-02,196K ctx)/M2.7(2026-04-12) | 未標公開總參數 | M2.5=標準 MIT;M2.7=Modified-MIT | 企業商用建議只選 M2.5;M2.7 商用需書面授權,社群批評為「假開源」 |
| GLM(智譜/Z.ai) | GLM-5.2(2026-06-13);前身 GLM-5(02 月)、GLM-5.1(04-07) | 744B MoE(40B 激活) | MIT(GLM-5.1 起) | 1M context;GLM-5.2 主打程式碼生成 |
| Kimi(Moonshot AI) | K3,2026-07-16 發表、07-27 開放權重 | 2.8T(混合線性+全注意力架構) | 「Kimi K3 License」/Modified MIT 型自訂授權 | 商用前務必核對官方授權條文,不可直接假設等同標準 MIT;1M context |
| Hunyuan(騰訊) | Hy3/Hunyuan 3.0 正式版(2026-07-06 全球開放) | 295B MoE(21B 激活+3.8B MTP) | Apache 2.0,無地域限制(僅限 07-06 後正式版) | 04-23 的 preview 版是限制性授權且排除歐盟/英國/南韓,只能引用正式版說法;256K context |
| InternLM(上海AI實驗室) | InternLM3(一般對話/推理主線);另有科學專用 Intern-S1-Pro(1T,2026-02-04) | 依版本 | Apache 2.0 | 官方承諾持續免費商用授權;Intern-S1-Pro 是科學計算模型,不等於企業泛用 LLM |
授權紅綠燈:一眼看懂能不能直接商用
- 🟢 完全自由商用:Qwen(全系列)、DeepSeek(全系列)、GLM(5.1 起)、Hunyuan(07-06 正式版起)、InternLM、MiniMax M2.5
- 🟡 商用需額外確認條款:MiniMax M2.7(需書面授權)、Kimi K3(自訂授權條文需逐條核對)
- 🔴 不開源不可地端:Qwen3.7-Max(API-only)
模型版本更新速度快,完整的授權細節與各模型部署教學,可參考中國開源大模型全盤點,個別部署與資安考量可分別參考Qwen 地端部署、DeepSeek 地端部署與資安、MiniMax 地端部署與授權地雷三篇文章。
五、部署框架怎麼選:Ollama 還是 vLLM/SGLang?
部署框架不是二選一的競品:Ollama 適合概念驗證與單人測試,vLLM 與 SGLang 才撐得住多人生產環境的併發量。很多團隊搞錯順序,一開始就想部署生產級框架,反而拖慢了驗證速度。
- Ollama:安裝快、操作簡單,適合 IT 人員自己先跑起來看效果,但單人或極少數併發使用,不適合當作全公司的生產服務。
- vLLM/SGLang:支援 batching、多用戶併發,是生產環境的標準選擇,但部署與調校門檻較高,通常需要熟悉 Linux/GPU 環境的工程團隊或委外服務。
沒有絕對的優劣,實務上常見的路徑是「先用 Ollama 驗證模型能不能用,確定要上線生產環境再換 vLLM 或 SGLang」。Ollama 在企業場景會遇到的具體限制,可參考Ollama 企業使用的極限。
六、地端 LLM 建置流程 SOP:評估、採購、部署、驗收
地端 LLM 建置照四個階段走最不容易出錯:需求評估→設備採購→系統部署→驗收上線,每個階段都有具體要確認的項目。跳過任何一步,通常是後續踩坑的起點。
| 階段 | 重點工作 | 常見坑 |
|---|---|---|
| ① 需求評估 | 確認使用人數、併發量、資料敏感度、是否需要斷網 | 沒抓對規模,導致設備不夠或閒置浪費 |
| ② 設備採購 | 依規模選小型/中型/大型路線,確認保固與原廠授權服務 | 買了設備卻沒有原廠服務中心支援 |
| ③ 系統部署 | 安裝作業系統、部署框架(Ollama/vLLM/SGLang)、載入模型 | 部署框架選錯,導致併發撐不住 |
| ④ 驗收上線 | 測試併發負載、確認網段隔離與存取權限、教育使用者 | 只測過單人使用,沒測過多人併發就上線 |
如果企業內部沒有足夠的 IT 人力走完整個 SOP,委外評估與部署是常見做法,可參考蓋斯克科技的IT 委外服務。
七、地端不等於安全:主機的網段隔離與防火牆
把 LLM 主機搬進辦公室不會自動變安全,沒有獨立網段與防火牆規則,內部風險甚至可能比雲端更高。「地端」處理的是資料主權問題,不是資安問題,兩者要分開看。
如果地端主機跟一般辦公網路混在同一個網段,任何一台被入侵的員工電腦都可能直接碰到 AI 主機,這跟「資料不出門」的初衷正好相反。基本作法是把 AI 主機獨立劃到專屬網段,只開放必要的推論埠給內部使用者,對外連線預設關閉。存取控制與紀錄留存也是常被忽略的一環——誰能用這台主機、用了什麼、log 怎麼留存,都需要在上線前先定義清楚,而不是出事後才回頭補。
「地端 AI 主機的資安建置」——包含獨立網段規劃、防火牆規則、存取稽核與 LLM 護欄層的完整作法——是一個獨立的大主題,蓋斯克科技另有專文整理。這裡先建立正確的心態:地端只是把風險搬到自己家裡管,不代表風險消失。
八、蓋斯克怎麼做:從硬體評估到原廠授權服務
蓋斯克科技目前已導入 DGX Spark 進行地端部署評估與測試,並具備 UniFi 認證與 QNAP、MOXA 原廠授權服務中心資格,可以從硬體採購到後續維運提供在地支援。累積實務經驗的同時,也持續驗證不同規模的地端 LLM 建置怎麼做才務實。
除了主機硬體,蓋斯克科技本身持有 UniFi 認證,同時是 QNAP、MOXA 的原廠授權服務中心,服務範圍涵蓋企業 Wi-Fi 建置、IT 委外、設備租賃、企業網路規劃與 NAS/雲端儲存,可以在地端 LLM 主機之外,一併處理周邊的網路與儲存架構。地端 LLM 建置沒有一套適用所有公司的公版方案,實際規模、預算與時程都需要依現場條件評估。
三個重點收斂:先抓對規模再談預算、模型看授權不是只看跑分、地端安全要主動做網段隔離。不管是先用小型路線驗證,還是已經準備好上生產環境,蓋斯克科技可以從硬體選型開始協助評估。
要開始評估地端 LLM,第一步是先確定自己的規模路線
蓋斯克科技提供免費現場評估與方案試算,協助你判斷該從小型驗證還是中大型生產路線開始,不編造具體服務費數字,實際費用依現場規模報價。
預約免費現場評估 了解 IT 委外服務電話:02-2717-1019 LINE:@zonetech
關於作者
Gask Hung|蓋斯克科技[職稱需確認],專注台灣中小企業 IT:企業 Wi-Fi、4K 剪輯系統、IT 委外與設備租賃。完整作者介紹
延伸閱讀:中國開源大模型全盤點|LLM 主機規格對照表|設備租賃服務
更多關於地端 LLM 建置的常見問題FAQ
Q1:中小企業一定要做地端 LLM 嗎?
不一定。如果資料不涉及機密、用量不穩定,雲端 API 通常比自建划算;但若有資料不能出雲、長期高頻使用、或想省下持續累積的雲端費用,地端才是划算的選項,關鍵在用量規模而不是跟風。
Q2:地端 LLM 建置要花多少錢?
依規模差很大。小型單機路線(如 DGX Spark、華碩 Ascent GX10)硬體約 NT$16-24 萬起(2026 年 8 月市價),中型多卡工作站與大型機房級沒有公版報價,需依實際配置與服務範圍現場估算。
Q3:哪個開源模型比較好?
沒有單一答案,要看授權與規模需求。Qwen、DeepSeek、GLM(5.1 起)、Hunyuan(07-06 正式版起)都是可自由商用的 Apache 2.0 或 MIT 授權;MiniMax 建議選 M2.5,M2.7 需另外簽署書面授權才能商用。
Q4:地端 LLM 多久可以建好?
小型驗證路線(單機+Ollama)最快,設備到貨後可在數天內完成基本部署;中大型生產環境涉及框架調校、網段規劃與驗收測試,時程需依規模與現場條件評估,沒有一體適用的天數。
Q5:跟雲端 API 比,該怎麼選?
用量不穩定或還在驗證階段,雲端 API 的初期成本較低;用量大且穩定、或資料不能出門,地端的邊際成本會比持續累積的 API 費用更划算。實務上不少企業採混合策略,兩者並存。
Q6:地端 LLM 安全嗎?
地端只是把資料留在自己機房,不代表自動安全。主機仍需要獨立網段、防火牆規則與存取控管,沒有做好隔離的地端主機,風險可能不比雲端低。
Q7:建置後需要多少人維護?
沒有固定人數,取決於使用規模與框架複雜度。小型單機路線多半由現有 IT 人員兼顧即可;中大型生產環境的併發調校與資安維運,建議搭配委外服務或原廠授權服務中心支援。
Q8:可以先用小規模測試嗎?
可以,這也是建議的起步方式。用單機路線(如 DGX Spark 或華碩 Ascent GX10 級距的主機)搭配 Ollama 先驗證模型可行性,確定要上線生產環境再評估中大型路線與 vLLM/SGLang 框架。





