資訊設備大小事

Qwen3.5/3.6 地端部署完全指南:尺寸選擇、硬體需求與企業商用授權

2026-08-07

Qwen3.5/3.6 地端部署完全指南:尺寸選擇、硬體需求與企業商用授權

發布:2026-08-06|最後更新:2026-08-07

很多企業一聽到「跑開源模型」,第一個念頭是找 ChatGPT 或雲端 API 的替代品,結果一查資料就卡關:繁體中文教學不是簡體轉載、就是版本過舊,甚至有文章把已經下架成 API-only 服務的版本,寫成「可以地端部署」,看了反而更混亂。Qwen3.5 與 Qwen3.6 是目前少數同時滿足「完全開源、可自由商用、有九種尺寸可選」三個條件的模型家族,但版本認錯、尺寸選錯,是企業評估地端部署時最容易踩的兩個坑。

Qwen 地端部署的關鍵有三件事:(1) 先分清楚版本——Qwen3.5 與 Qwen3.6 全系列採用 Apache 2.0 授權可自由商用,但 2026 年 5 月發布的 Qwen3.7-Max 是 API-only 服務,不開源也無法地端部署;(2) 依 VRAM 預算挑尺寸,從 0.8B 到 397B-A17B 都有選項,不是參數愈大愈好;(3) 概念驗證階段用 Ollama 上手,正式上線再換成 vLLM 或 SGLang 處理多人併發。本文整理 2026 年 8 月最新版本資訊,提供尺寸選擇、授權解讀與部署路徑的完整判斷依據。

本文重點摘要

  • Qwen3.5(2026-02-16)與 Qwen3.6(2026-04)全系列採用 Apache 2.0 授權,可自由商用、修改、無需付費
  • 為什麼強:27B 中型尺寸實測打贏自家 397B 旗艦版、消費級硬體也能跑,社群公認是目前「多數人能跑得動的最強本地組合」之一
  • 尺寸從 0.8B 到 397B-A17B(MoE),挑選關鍵是 VRAM 預算與併發人數,不是參數愈大愈好
  • Qwen3.7-Max(2026-05-19)是 API-only 服務,不開源、不能地端部署,別跟前兩代搞混
  • 上手用 Ollama 測試,正式上線改用 vLLM/SGLang 處理多用戶併發需求

適合閱讀對象

正在評估地端部署開源模型的 IT 主管、比較 Qwen/DeepSeek 等開源選項的技術負責人、已決定導入但不確定硬體規格的採購與工程人員

不確定你的環境該選哪個 Qwen 尺寸?加 LINE 傳你的使用情境(人數/用途/現有設備),我們先幫你初步評估 → 加 LINE 諮詢

一、Qwen3.5/3.6 是什麼?版本與授權總覽

Qwen3.5 與 Qwen3.6 是阿里巴巴 Qwen 團隊發布的開源大型語言模型家族,用於企業自建的地端(On-Premise)AI 部署。兩者都是完全開源、可下載權重自行架設的模型,這一點跟只能透過雲端 API 呼叫的服務(例如 ChatGPT、或 Qwen 自家的 Qwen3.7-Max)完全不同。

一個好懂的比喻:如果把大型語言模型想成一台車,雲端 API 像是叫車服務——上車就走,油錢(token 費用)按里程算,行駛路線(資料流向)也不在你手上;地端部署則像是自己買一台車放在自家車庫,油錢只剩下電費(硬體與電力),路線完全自己決定,但你得先確定車庫塞不塞得下(VRAM 夠不夠)。Qwen3.5/3.6 的角色,就是市面上少數「買斷就能自己開」的整車型號之一。

根據 Qwen 官方 GitHub 文件,目前可地端部署的版本與時間軸如下:

版本 發布日期 規模 授權 Context 長度
Qwen3.52026-02-16九種規模,0.8B–397B-A17B(MoE)Apache 2.0262K
Qwen3.6-35B-A3B(MoE)2026-04-1635B 總參數/約 3B 活躍參數Apache 2.0262K
Qwen3.6-27B(Dense)2026-04-2227BApache 2.0262K

Qwen3.7-Max(2026-05-19 發布)與更新的 Qwen3.8-Max(2026-08 開始在社群討論中出現,官方宣稱 2.4T 總參數、95B 激活)都不在這份清單裡,原因很單純:兩者延續「Max」系列的定位,目前沒有查到官方釋出開放權重的公告,屬於 API-only 服務,無法下載、無法地端部署。這是繁體中文資訊圈最容易搞混的一點——不少文章直接把「Qwen 最新版」等同「可以地端部署的最新版」,但想要地端自建,目前能選的仍然是 Qwen3.5 與 Qwen3.6 這兩個系列。導入前建議直接核對官方公告的版本清單,避免把 API-only 的服務誤植入建置規劃。

如果你正在規劃完整的地端 LLM 建置專案,不只是單一模型的選型,可以參考蓋斯克科技的《地端 LLM 建置完整指南》,裡面涵蓋硬體、模型、部署框架與資安的整體決策架構。

二、Qwen 為什麼被認為很強:市場口碑與真實案例

Qwen 在開發者社群被認為很強,核心原因是「用更小的模型打贏更大的模型」——這件事在 2026 年被多次公開驗證,而不是廠商自己說的。把幾個具體的例子攤開來看,比單純相信「阿里出品」這個標籤更有說服力。

小尺寸打贏大尺寸:推論工具開發商 Unsloth 公開測試指出,27B 的 Qwen3.6-27B 在多個公開 coding benchmark 上,表現超越自家規模大上十幾倍的 Qwen3.5-397B-A17B(旗艦 MoE 版本)。這代表 Qwen 團隊在訓練方法上的進步,讓中型尺寸就能做到過去要旗艦規模才有的水準——對地端部署來說,這直接反映在硬體門檻上:不用堆到百 B 規模的機房級設備,中型尺寸就可能滿足企業需求。

消費級硬體也能跑得動:社群透過 Unsloth 的 Dynamic GGUF 量化技術,讓 Qwen3.6-27B 能在 18GB RAM 的一般設備上運作,搭配 MTP(多令牌預測)技術還能再加速 1.4 到 2.2 倍;也有開發者實測在一般消費級顯卡上跑出每秒 87 個 token 的速度。這說明 Qwen 的地端部署門檻,不是只有企業機房等級才玩得起。

「Hermes Agent 搭配 Qwen 3.6,是目前多數人能跑得動的最強本地組合——就算前沿模型明天就停止進步,這套組合依然能覆蓋大部分實際工作需求。」——X 用戶 @IBuzovskyi,2026 年 6 月

創辦團隊的技術路線:Qwen 團隊工程師 Junyang Lin 在一場技術工作坊中談到 Qwen 的定位:「Claude 沒有在推理上贏,他們把籌碼全押在 agent 能力上——但大家都跳過的那一層是,好的 agent 需要一個好的基礎模型,那正是 Qwen 在做的事。」這也解釋了為什麼 Qwen 系列在 agentic coding(自動化寫程式)場景的社群評價持續偏正面。

要提醒的是,以上都是開發者社群在 X 平台上的個案分享與意見,不是 Qwen 官方公布的跑分成績,實際效能仍會因為量化格式、推論框架與使用場景而有落差,正式導入前建議用自己的業務語料實測,不要只看社群評價就下決定。

三、Qwen3.5 尺寸怎麼選?VRAM 與適合場景對照表

Qwen3.5 官方在 2026 年 2 月起陸續發布了九種參數規模,從 0.8B 的輕量模型到 397B-A17B(MoE)的旗艦版本都有,但選型的關鍵不是「參數愈大愈好」,而是你的 VRAM 預算與同時使用人數。依照粗略量化估算,可以把整個規模範圍切成三個實務分級:

分級 涵蓋規模區間 建議 VRAM(Q4 量化估算) 建議 VRAM(FP16 估算) 適合場景
① 輕量級0.8B〜9B(Dense)約 1–6GB約 2–18GB邊緣裝置、筆電、快速 POC 概念驗證
② 中型級27B 級/35B-A3B(MoE)約 16–24GB約 54–70GB中小企業內部 AI 助理、RAG 文件問答、單機生產
③ 大型旗艦122B〜397B-A17B(MoE)約 70–260GB約 244–800GB 以上大型企業級生產、高精度 coding agent、多用戶高併發

這裡有一個很多人抓錯規格的地方:MoE(混合專家)架構的模型,VRAM 需求要看「總參數」而不是「啟用參數」。以旗艦版 397B-A17B 為例,雖然每次運算實際只啟用約 17B 參數,但完整模型權重仍然要全部載入記憶體才能運作,不能只按活躍參數去抓 VRAM,這是地端部署 MoE 模型時最常見的誤判。

以上 VRAM 數字,是蓋斯克科技依常見的 4-bit(Q4/GPTQ/NVFP4 等)量化公式概算(參數量 × 約 0.5–0.6 byte,再加上 KV cache 與 context 視窗的額外開銷),不是特定測試分數,而是估算區間。實際負載會依推論框架、批次大小與 context 長度而變動,正式導入前建議把現有設備規格與預期使用場景提供給蓋斯克科技,由我們協助做免費現場評估,確認最終規格。想進一步了解不同顯卡與預算帶的完整對照,也可以參考蓋斯克科技的《LLM 主機規格對照表》

Qwen3.5尺寸VRAM需求與適合場景對照圖|蓋斯克科技
Qwen3.5 三種規模分級的 VRAM 需求估算與適合場景(僅供概算,實際依現場為準)

四、Apache 2.0 授權對企業真正的意義

Qwen3.5 與 Qwen3.6 全系列採用 Apache 2.0 授權,代表企業可以自由使用、修改、散布,甚至把微調後的衍生模型包裝成付費產品對外提供服務,完全不需要另外付費,也不用簽署任何書面授權文件。這是評估開源模型時最容易被忽略、但對企業法務風險影響最大的一項條件。

All our open-weight models are licensed under Apache 2.0.

Qwen 團隊,QwenLM/Qwen3.6 官方 GitHub 文件

Apache 2.0 不要求你公開自己的修改內容,也不要求你揭露訓練資料或微調流程,這代表企業可以把 Qwen 拿來做內部系統整合,甚至客製化後轉售,而不會有授權合規上的顧慮。這一點並不是所有「開源」模型都能做到——同樣主打地端部署的 MiniMax M2.7,商用就需要額外取得書面授權,是很多人誤以為「開源就等於能商用」時容易踩到的地雷。相較之下,Qwen 全系列(3.5 與 3.6)維持標準 Apache 2.0,對企業來說是最單純、法務風險最低的授權條件之一,也是本文一開始就把它列為地端部署首選候選的原因。

對台灣中小企業而言,Apache 2.0 授權還有一個實際好處:不需要為了商用而額外編列授權費用預算,前期投入可以完全集中在硬體與部署服務上,這也是地端 LLM 專案比雲端 API 更容易做長期成本試算的原因之一。

想知道你的環境適不適合導入 Qwen?

LINE 傳訊描述你的設備規模與使用情境,免費給你初步可行性評估,不用先約不用先付錢。

LINE 詢問 AI 導入 → 預約免費健診

五、快速上手:用 Ollama 三步驟跑起來

概念驗證階段,最快的上手方式是透過 Ollama:安裝好之後,把上一節選定的 Qwen 尺寸下載下來,接著就能直接在本機對話測試。整個流程不需要寫程式,也不需要架設伺服器,適合技術團隊在正式導入前,先確認模型的回答品質與速度是否符合預期。

  • 第一步、安裝 Ollama:支援 Mac、Windows、Linux,下載官方安裝程式後執行即可,不需要額外設定推論引擎。
  • 第二步、下載模型:依照第二節選定的尺寸,把對應的 Qwen 模型檔案下載到本機——尺寸愈大,下載與硬碟空間需求也愈大,建議先確認網路與儲存空間足夠。
  • 第三步、啟動測試:模型下載完成後即可直接對話測試,觀察回答速度、記憶體占用,以及是否符合你原本評估的使用場景(例如內部問答、文件摘要)。

Qwen 官方支援的推論框架清單包含 vLLM、SGLang、Transformers、llama.cpp、MLX,Ollama 底層用的正是 llama.cpp 這套生態系,這也是它能快速上手、跨平台安裝簡單的原因。不過要提醒的是,Ollama 適合概念驗證與技術評估,不建議直接拿來當作多人同時使用的正式生產環境——它在單一使用者情境下體驗流暢,但面對多人併發請求時,效能會明顯下滑,這一點下一節會具體說明。

六、生產環境:vLLM/SGLang 部署路徑

當使用人數超過個位數,或需要當作公司內部「自己的 ChatGPT」正式上線時,就該從 Ollama 換成 vLLM 或 SGLang 這類支援併發批次處理的生產級推論框架。兩者都在 Qwen 官方支援清單內,也是目前開源社群最主流的生產部署方案。

Ollama 的設計偏向單一使用者、單一請求依序處理,多人同時發問時容易出現排隊等待、回應變慢的情況。vLLM 與 SGLang 則是針對多請求併發設計,透過批次處理與記憶體管理機制,讓同一台主機能同時服務多個使用者,而不是讓每個人排隊等前一個人的請求跑完。這對「一台主機給全公司用」的情境來說是必要的升級,而不是錦上添花——如果你的目標是取代團隊日常使用的雲端 AI 工具,跳過這一步幾乎一定會在多人同時使用時卡關。

正式部署 vLLM/SGLang 涉及 GPU 驅動版本、compute capability 相容性、記憶體配置與併發參數調校,這部分建議由有地端 AI 部署經驗的 IT 團隊協助設定,避免因為版本相容性問題延誤上線時程。若你的團隊沒有相關經驗,也可以參考蓋斯克科技的《Ollama 企業使用的極限》,先了解 Ollama 在多人併發情境下實際會遇到哪些瓶頸,再決定要不要投入資源升級到生產級框架。

七、Qwen 適合哪些企業場景?

從開源社群實際使用模式來看,Qwen 系列最常被拿來做三件事:agentic coding(自動化寫程式)、內部文件的 RAG 問答,以及客服/工單類型的文字處理。這三類場景剛好也是台灣中小企業評估地端 LLM 時最常見的需求。

  • Coding agent/自動化開發輔助:搭配 IDE 或指令列工具,讓 Qwen 協助生成程式碼、重構既有邏輯、或產生單元測試,適合有內部開發團隊、想加速日常開發流程的企業。
  • 內部文件 RAG 問答:把公司內部的 SOP、法規文件、技術手冊建立成知識庫,讓員工用自然語言查詢,資料全程留在企業內部,不會經過第三方雲端服務,適合對資料外流有顧慮的產業。
  • 客服與工單分類:用於初步分類客戶問題、生成制式回覆草稿,或協助整理工單內容,降低第一線人員的重複性文字工作負擔。

這三類場景有一個共通點:都不需要模型具備世界最頂尖的推理能力,反而更看重「資料不出門」與「回應速度穩定」,這正好是地端部署相對雲端 API 的核心優勢,也是 Qwen 這類尺寸選擇廣、授權自由的開源模型家族,特別適合中小企業導入的原因。

八、Qwen 中文能力好嗎?跟 DeepSeek 怎麼選?

Qwen 由長期投入中文語料訓練的團隊開發,在繁體中文的語意理解與生成上,體感表現普遍不遜於多數西方主流開源模型,但目前沒有官方公開、可直接引用的繁體中文評測分數,實際導入前仍建議用你自己的業務語料實測比較。

至於跟 DeepSeek 怎麼選,兩者都是可地端部署、授權寬鬆的開源家族(DeepSeek 採 MIT 授權),差異主要在規模定位:DeepSeek 目前主力版本集中在數百 B 到 1.6T 之間,偏重推理與程式碼生成的極限效能;Qwen 的尺寸選擇範圍更廣,從 0.8B 到 397B-A17B 都有,更容易依照企業實際的硬體預算做漸進式部署,不必一開始就投入機房等級的硬體才能上線。如果你還在猶豫該選哪一家,完整的家族比較與硬體需求,可以參考蓋斯克科技的《中國開源大模型全盤點》,以及專門討論資安考量的《DeepSeek 地端部署與資安》

結論:先確認版本與尺寸,再談部署框架

Qwen3.5 與 Qwen3.6 的地端部署決策,可以濃縮成三個判斷:先確認版本——只有 Qwen3.5 與 Qwen3.6 能地端部署,Qwen3.7-Max 是 API-only 服務;再依 VRAM 預算與使用人數挑尺寸,MoE 架構要看總參數而不是啟用參數;最後依規模選部署框架,POC 用 Ollama,正式上線改用 vLLM 或 SGLang。Apache 2.0 授權讓這整套決策不需要額外考慮授權費用,是目前企業評估地端開源模型時,法務與預算風險都相對單純的選項之一。

立即開始:你的 Qwen 地端部署評估值得一次免費現場評估

蓋斯克科技長期協助台灣中小企業處理企業 Wi-Fi、IT 委外與硬體建置需求,也持續投入地端 AI 部署的評估與導入服務。從尺寸選型、VRAM 硬體規格確認,到 Ollama 概念驗證與 vLLM/SGLang 正式上線,我們可以陪你走完整個流程。

我們提供:

  • 依你現有設備與使用情境,量身評估適合的 Qwen 尺寸與硬體規格
  • Ollama 概念驗證與 vLLM/SGLang 正式部署的技術協助
  • 透明溝通,不編造報價,依現場規模給出實際評估
  • 後續維運與 IT 委外整合服務

不確定自己的環境適不適合導入 Qwen 地端部署?

蓋斯克科技提供免費現場評估與方案試算,先幫你確認硬體是否足夠、該選哪個尺寸,再決定要不要投入建置。

免費預約評估

電話:02-2717-1019 LINE:@zonetech

關於作者

Gask Hung|蓋斯克科技負責人,專注台灣中小企業 IT:企業 Wi-Fi、4K 剪輯系統、IT 委外與設備租賃,近期投入地端 AI/LLM 部署的評估與導入服務。完整作者介紹

延伸閱讀:地端 LLM 建置完整指南LLM 主機規格對照表IT 委外服務

更多關於 Qwen 地端部署的常見問題FAQ

Q1:Qwen 可以免費商用嗎?

Qwen3.5 與 Qwen3.6 全系列採用 Apache 2.0 授權,可以免費商用,包括修改、整合進自家產品與對外提供付費服務,不需要另外付費或簽署書面授權。唯一要避開的是 Qwen3.7-Max——那是 API-only 服務,不開源也無法地端部署。

Q2:Qwen 地端部署需要多少 VRAM?

依尺寸差異很大:輕量級(0.8B–9B)約 1–6GB VRAM(Q4 量化估算)就能跑,中型級(27B/35B-A3B)約需 16–24GB,旗艦 397B-A17B 則要 70–260GB 以上。建議先確認使用人數與場景,再抓對應硬體規格。

Q3:Qwen 跟 ChatGPT 比怎麼樣?

ChatGPT 是封閉 API 服務,資料會經過 OpenAI 伺服器;Qwen 是開源模型,可以完全部署在企業自己的機房或主機內,資料不出門。效能上一線雲端模型通常略勝一籌,但 Qwen 勝在授權自由與資料主權,適合對資安或合規有要求的企業。

Q4:一定要用 vLLM 嗎?Ollama 夠不夠用?

不一定。單人測試或概念驗證用 Ollama 就足夠,操作簡單;但若要給 10 人以上同時使用,Ollama 容易因為排隊處理而變慢,這時候需要改用 vLLM 或 SGLang 這類支援併發批次處理的生產級框架。

Q5:怎麼知道我的環境適合哪個 Qwen 尺寸?

先確認兩件事:現有 GPU 的 VRAM 容量,以及預期同時使用的人數。VRAM 決定能跑哪個尺寸,使用人數決定要不要上 vLLM 等併發框架。不確定的話,可以把現有設備規格傳給蓋斯克科技,先做免費初步評估。

Q6:沒有 GPU,只有一般伺服器可以跑 Qwen 嗎?

輕量級的 0.8B 到 2B 等級模型,理論上可以用 CPU 推論,但速度會明顯變慢,不適合正式服務使用。若要有實用的回應速度,建議至少搭配一張具備足夠 VRAM 的獨立顯卡。

Q7:企業導入 Qwen 地端部署,流程要多久?

從概念驗證到正式上線,依規模複雜度不同,一般落在數週到一至兩個月之間,包含硬體確認、模型部署測試、併發壓力測試與內部教育訓練。實際時程依現場環境與需求範圍而定。

Q8:跟 DeepSeek 比,Qwen 哪個比較適合?

兩者都是可地端部署的開源選項。DeepSeek 規模較大、偏重推理與程式碼生成的極限效能;Qwen 尺寸選擇更廣,從輕量到旗艦都有,更容易依預算漸進部署。完整比較建議參考蓋斯克科技《中國開源大模型全盤點》。

Q9:Qwen 為什麼在開發者社群評價這麼高?

主要是訓練效率的具體證據:27B 的 Qwen3.6 在多個公開 coding benchmark 上超越自家規模大十幾倍的 397B 旗艦版,代表中型尺寸就能做到過去要旗艦規模才有的水準。加上消費級硬體也能跑得動(18GB RAM 即可),社群普遍認為它是目前「多數人能跑得動的最強本地組合」之一。

蓋斯克科技

企業級網路規劃
電話:02-27171019
商家:https://g.page/zonetech-tw
地址:10491臺北市中山區建國北路二段125號4樓

分享至Facebook

精選文章

📍 服務地區

台北辦公室網路規劃 新北企業資訊委外 台北IT委外服務 新北網路建置規劃 台北設備租賃 新北設備租賃