Qwen3.8 正式開放權重,由 2.4T-A95B 巨型模型到 Qwen3.8-27B 企業部署選擇

Qwen3.8 正式開放權重:點解企業更應留意 Qwen3.8-27B?

懶人包(TL;DR)

  • Qwen3.8 不是一個單一模型,而是一個新模型世代。首批焦點包括 2.4T-A95B 巨型 MoE 模型,以及較貼近企業部署評估的 Qwen3.8-27B Dense 模型。
  • Qwen3.8-27B 雖然參數規模細得多,但不是「縮水版 Chatbot」。它原生支援圖像及影片理解、Agent 執行、可調整推理深度,以及 262K Context。
  • 官方 Model Card 顯示它在軟件工程、專業工作、網頁操作及文件理解等測試上較 Qwen3.6-27B 有進步,但這些屬供應商公布數據,不能直接等同企業實際回報。
  • Qwen 的企業化亦不只在模型參數。截至 2026 年 8 月 18 日,QwenWork 官方文件已列出釘釘、飛書及企業微信等協作入口,但各平台仍要按本身方式授權和配置。
  • 27B 不代表任何普通手提電腦都可以順暢運行。實際硬件、速度及成本仍受精度、量化、Context 長度、並發量和多模態工作影響。
  • 企業真正要決定的,不只是「用不用 Qwen」,而是它要處理哪一段工作、資料可以放在哪裡、如何接駁工具,以及如何驗收。

2026 年 8 月,Qwen 團隊相隔兩日先後公開兩款 Qwen3.8 模型權重:8 月 12 日發布 Qwen3.8-2.4T-A95B,8 月 14 日再發布 Qwen3.8-27B。前者把 Qwen-Max 級別模型首次帶到公開權重;後者則把新一代的 Agent、多模態及長 Context 能力,放進一個企業較有機會實際評估的規模。

這亦是理解今次更新最重要的角度。2.4T 代表前沿能力可以去到哪裡;27B 則令更多企業開始認真問:這類能力是否已經接近可部署、可控制、可量度?

以下會集中拆解兩個模型的分別、Qwen3.8-27B 真正值得留意的地方,以及企業在看 Benchmark 之後,還需要問哪些問題。如果想先補回整個模型家族的背景,可以先看我們的Qwen 模型系列背景文章

1. Qwen3.8 是一個模型世代,不是一個單一型號

看到「Qwen3.8」這個名字,很容易以為它只是一款新 Chatbot。實際上,Qwen3.8 是一個模型世代,首批兩款公開模型走的是兩條很不同的路線。

Qwen3.8-2.4T-A95B 採用 Mixture-of-Experts(MoE)架構,總參數達 2.4T,但每次處理只啟用其中 95B。官方將它定位為首款公開權重的 Qwen-Max 級別模型,重點是把大型前沿模型的能力公開出來。這並不等於它的部署要求只有 95B;95B 是每次推理啟用的參數量,完整權重、記憶體、通訊及吞吐量仍然是大規模系統問題。

亦要分清公開 checkpoint 與託管產品:2.4T-A95B 的公開版本是文字生成模型,只提供 Thinking Mode;官方託管的 Qwen3.8-Max 才另外提供視覺輸入、Non-thinking、預設 1M Context 及內置工具。這些功能不能直接當成公開權重版本已經具備。

Qwen3.8-27B 則是一款 27B Dense 模型。Dense 的意思是推理時會使用整個模型,不是按輸入只啟用部分專家。它的規模遠低於 2.4T-A95B,部署路徑亦相對容易理解,因此更可能成為企業技術團隊實際測試的起點。

Qwen3.8 模型家族比較:2.4T-A95B MoE 巨型模型與 Qwen3.8-27B Dense 多模態模型
兩款模型屬同一世代,但運算尺度和部署目的不同。資料來自 Qwen 官方 Model Card。
共同點:兩款模型的原生 Context 均為 262,144 tokens,官方亦提供延伸至約 100 萬 tokens 的方法。不過「放得入」不代表「每次都應該放滿」;Context 愈長,速度、記憶體、成本和找出真正相關資料的難度亦會增加。

授權則不相同:Qwen3.8-27B 採用 Apache License 2.0;2.4T-A95B 採用 Qwen3.8-Max License。企業不能把「兩款都有公開權重」理解成「兩款使用完全相同的開源授權」。

2. 點解企業更應留意 Qwen3.8-27B?

企業評估模型時,通常不是單純追求排行榜最高分。團隊還要考慮資料位置、硬件、速度、可維護性,以及能否將模型接入現有系統。從這個角度看,27B 的意義不只是「模型較細」,而是它保留了今代幾項重要能力,同時把測試門檻拉到較務實的範圍。

由文字模型,走向原生多模態工作

Qwen3.8-27B 原生結合視覺編碼器,可以處理文字、圖片及影片。對企業來說,這比「識睇相」更具體:同一個工作可能同時包含報告、表格截圖、產品圖片、操作畫面和文字指示,不必先將每一種資料交給完全不同的模型。

但多模態並不代表模型自動理解公司語境。例如讀取發票、檢查產品圖或整理教學影片時,企業仍要定義輸入格式、錯誤處理、敏感資料及人工覆核。

由回答問題,走向 Agent 執行

官方把 Agent 能力放在 Qwen3.8 的核心位置。簡單來說,模型不只生成一段答案,還可以在獲授權的情況下選擇工具、執行步驟、讀取結果,再決定下一步。這種模式較接近實際工作,例如搜尋內部文件、整理資料、操作瀏覽器或協助程式開發。

真正的難位也在這裡:Agent 做得愈多,權限、紀錄、錯誤恢復和人工接管就愈重要。模型本身的能力只是其中一層,還需要穩定的Prompt、Context、Harness 與驗證方法,才有機會把示範變成可重複流程。

最新企業化訊號:Qwen 正由模型走進工作入口。

截至 2026 年 8 月 18 日,QwenWork 官方文件已列出釘釘、飛書、企業微信、Slack 及 WhatsApp 等協作渠道。用戶可以在聊天工具發起文字、語音、圖片或文件任務,結果返回原有會話;但釘釘、飛書和企業微信均有各自的綁定、機械人或管理員配置要求,並非毋須授權就能直接讀取公司資料。

另一邊,阿里巴巴向 Reuters 表示,Qwen 將整合至中國版 Apple Intelligence。Reuters 其後再引述知情人士,指 Apple 在阿里協助下訓練面向中國市場的模型;不過 Apple 與阿里未有公開確認該項訓練細節,具體上線時間、採用的 Qwen 版本及系統分工亦未公布。現階段不能據此斷言 Apple 使用的是 Qwen3.8 或 Qwen3.8-27B。

推理深度可以按任務調整

Qwen3.8-27B 預設開啟 Thinking Mode,亦容許按請求關閉,或者使用不同 reasoning effort。日常分類、簡單抽取未必需要長時間推理;程式除錯、研究或多步工作則可能需要較深思考。能否按工作調整,會直接影響回應速度和運算成本。

所以 27B 真正值得測試的,不是它能否寫一篇文,而是它能否在公司指定的資料、工具、權限和時間限制內,穩定完成一段有開始、有結束、有人驗收的工作。

3. 官方 Benchmark 有進步,但應該點樣閱讀?

Qwen 官方 Model Card 提供了 Qwen3.8-27B 與 Qwen3.6-27B 的比較。在幾類企業較容易理解的測試中,新模型的分數均有上升:SWE-bench Pro 由 53.5 升至 61.7、CoWorkBench 由 61.0 升至 70.7、WebArena-Verified 由 48.8 升至 64.8,而 OmniDocBench 1.5 則由 89.4 升至 91.1。

Qwen3.8-27B 與 Qwen3.6-27B 的官方 Model Card Benchmark 比較,包括 SWE-bench Pro、CoWorkBench、WebArena 及 OmniDocBench
這些是 Qwen 官方 Model Card 公布的結果,不是 Ad-Linkage 或第三方獨立測試。

這組數字最有用的地方,是顯示模型發展方向:Qwen3.8-27B 不只改善一般問答,而是把重點推向軟件工程、專業工作、網頁操作和文件理解。不同測試的升幅並不一致,OmniDocBench 的變化亦明顯較細,因此不應將它們濃縮成一句「全面領先」。

不過,Benchmark 不能直接回答「放進我的公司是否有效」。部分測試由 Qwen 團隊自建,個別比較亦可能使用不同工具鏈、修正版資料或提示設定。即使同一模型,在不同權限、瀏覽器環境、文件格式及網絡速度下,結果亦可以相差很遠。

較穩妥的讀法:把官方 Benchmark 當成「值得安排下一輪測試」的訊號,而不是採購結論。最後仍要使用公司的真實工作樣本,比較準確度、完成時間、錯誤類型、人工修正及每次執行成本。

4. 放進企業場景,Qwen3.8-27B 可以由哪裡開始?

新模型發表後,最容易出現的誤解,是將每一項能力都變成一個宏大的轉型方案。較實際的做法,是先選一段可觀察的工作,看看 27B 的多模態、長 Context 或 Agent 能力是否真的有用。

研究、文件與管理報告

當工作同時涉及長文件、表格、截圖及多個來源,模型可以協助找出差異、整理證據、草擬摘要和列出待確認問題。長 Context 令它有機會在一次任務中看到更多材料,但企業仍應先整理來源、標示版本和要求模型指出證據位置,避免「材料放得多,答案卻找不到根據」。

程式開發與內部工具

SWE-bench Pro 和其他軟件工程相關結果,令 Qwen3.8-27B 值得技術團隊放進真實 repository 測試,例如理解現有程式、產生測試、提出修改及協助排查問題。這不等於可以略過 Code Review;相反,模型一旦可以執行指令,測試環境、存取權限及變更審批需要更加清楚。

瀏覽器與電腦操作

WebArena 等操作相關測試的進步,顯示它在理解介面及執行多步操作方面有更大潛力。企業可先從低風險、可撤回的工作測試,例如收集公開資料、整理後台數據或準備輸入草稿。涉及付款、發送訊息、刪除資料或修改客戶記錄時,應保留確認步驟,不應只靠模型自行判斷。

這三類場景的共同點,不是「全部自動化」,而是輸入、工具、權限、輸出和人工覆核都可以講清楚。

5. 由 Model Card 走到部署,企業要補回四個問題

企業部署 Qwen3.8-27B 前需要評估工作類型、資料位置、運算成本及驗收方法
模型能力只是起點;部署選擇要由工作、資料和驗收方法倒推。

第一,工作到底是甚麼?「做公司 AI」太闊。應該改成一段可測試的描述,例如:讀取某類文件和截圖、按公司規則整理差異、列出證據,再交由同事確認。

第二,資料可以放在哪裡?Qwen3.8-27B 的權重以 Apache 2.0 授權公開,企業可以研究自建部署;亦可評估雲端或其他託管方案。但自建不等於資料治理自然完成,雲端也不等於不能設計權限。團隊仍要釐清資料分類、日誌、保留期和供應商條款。

第三,運算取捨是甚麼?27B 比 2.4T-A95B 更接近企業可測試範圍,但不能簡化成「普通電腦都得」。精度、量化方式、Context 長度、同時使用人數、回應速度,以及是否處理圖像或影片,都會改變所需硬件和成本。官方 Model Card 列出 Transformers、vLLM、SGLang 等部署路徑,並提供社群量化版本入口;實際採用前仍要自行驗證品質和相容性。

第四,點樣知道它做得好?不要只問答案「似唔似人」。應預先準備一批真實但可安全使用的工作樣本,記錄正確完成、部分完成、錯誤和需要人工接管的情況,再比較時間及資源。模型升級之後亦要重新測試。

供應狀態提示:截至 2026 年 8 月 18 日,Qwen3.8-27B 官方 Model Card 已提供開放權重及部署指引,但其 Qwen Cloud 託管版本仍標示為「coming soon」。如計劃使用 API,應在開發前重新核對實際可用地區、型號、價格和資料條款。

6. Qwen3.8 對企業最大的改變,未必只是一個新模型

過去不少企業比較 AI,主要看哪個 Chatbot 回答得較好。Qwen3.8 帶出的問題已經不同:同一個模型世代,有前沿巨型 MoE、有較易部署的 Dense 模型;同一個 27B 模型,又同時牽涉多模態、工具使用、推理深度和長 Context。

這代表選型不能只靠一次對話。公司需要把模型放入一個完整環境:它看到哪些資料、可以使用哪些工具、出錯時如何停止、結果由誰確認,以及新版本推出時如何重做評估。

對香港企業而言,Qwen3.8-27B 最值得留意的地方,正是它令「是否採用開放權重模型」由研究題目,逐步變成架構和營運題目。這不代表每間公司都應自建,也不代表它一定優於雲端大型模型;但企業已經有更多空間,按資料、控制、速度及成本要求選擇不同路徑。

總結:先理解 27B 代表的選擇,再決定是否部署

Qwen3.8-2.4T-A95B 展示的是今代 Qwen 的能力上限;Qwen3.8-27B 則把問題拉回企業現場:一個規模相對可控的開放模型,能否處理多模態資料、使用工具、完成多步工作,並在公司要求的速度、成本和風險範圍內運行?

答案不會只在 Model Card 裡面。官方 Benchmark 可以幫你決定是否值得測試,但真正的採用決定,要由真實工作、部署環境和驗收結果共同回答。

由新聞理解,走到現場拆解

到阿里雲了解 Qwen 如何走進企業場景

Ad-Linkage 第 6 期杭州 AI 智能體實戰研習班將於 2026 年 10 月 23 至 25 日舉行,主題為「企業 AI 轉型 × Marketing」。公開行程包括阿里雲參訪及無影雲電腦體驗;按公開簡章,阿里雲資深架構師會講解雲端技術與企業應用,阿里雲團隊亦會即場拆解 Qwen3.8。

實際環節、講者及行程次序以出發前最終通知為準。研習團本身不應直接視作 CEF 資助課程。

常見問題 FAQ

Qwen3.8 和 Qwen3.8-27B 是同一樣東西嗎?

不是完全相同。Qwen3.8 是模型世代;Qwen3.8-27B 是這個世代其中一款 27B Dense 模型。同一批亦包括採用 MoE 架構、總參數 2.4T 而每次啟用 95B 的 Qwen3.8-2.4T-A95B。

Qwen3.8-27B 是否開源?可否商業使用?

官方以 Apache License 2.0 發布模型權重。這個授權一般容許商業使用、修改和再分發,但企業仍應由法務或合規人員按實際用途核對授權、第三方元件、資料及所在地法規;本文不是法律意見。

27B 是否代表普通手提電腦都可以運行?

不能單憑 27B 判斷。所需硬件會受精度、量化、Context 長度、速度要求、同時使用人數及多模態工作影響。部分量化版本可能降低記憶體門檻,但亦可能影響品質或相容性,應按真實任務測試。

Qwen3.8-27B 的 262K Context 是否愈長愈好?

不一定。長 Context 可以容納更多材料,但亦會增加運算、延遲和檢索難度。較好的做法是整理來源、刪除無關內容、保留引用位置,再按任務需要決定輸入多少資料。

官方 Benchmark 是否證明 Qwen3.8-27B 適合所有企業?

不是。官方數據顯示模型在特定測試下的能力方向,但企業環境的資料、工具、權限、介面和驗收標準都不同。採用前應以真實工作樣本進行小範圍評估。

第 6 期杭州研習團是否只教 Qwen?

不是。研習團主題為「企業 AI 轉型 × Marketing」,Qwen3.8 拆解是公開行程中的技術交流環節之一。行程亦包括企業 AI 營銷應用、阿里雲參訪及無影雲電腦體驗;實際安排以活動頁、公開簡章和出發前通知為準。

資料來源

相關內容