GLM-5.3-Flash 是智譜旗下 Z.ai 於 2026 年 8 月 26 日發布的 GLM-5 系列首個原生多模態模型,亦即早前在 OpenCode 及 OpenRouter 匿名測試的 ox-alpha。模型接受文字、圖片、影片及檔案輸入並輸出文字,規模為 320B 總參數、18B 激活參數,支援 1M token context、最高 128K token 輸出及工具調用。企業可經 Z.ai API 或 GLM Coding Plan 使用,亦可下載採用 MIT License 的開放權重自行部署;不過「Flash」代表較低推理成本,並不代表可在一般手提電腦順暢部署。
懶人包(TL;DR)
- 今次不只是 GLM-5.3 的平價版。GLM-5.3-Flash 使用全新多模態 base model,把視覺理解放入 coding、文件及 Agent 工作流程。
- 輸入可包括文字、圖片、影片及檔案,原生輸出仍是文字;要建立 PPTX、網站或操作介面,仍需配合工具及 Agent 執行環境。
- 官方規格是 320B 總參數、18B 激活參數、1M context、最高 128K 輸出;reasoning 必須啟用,只可選
low、high或max。 - 截至 2026 年 8 月 28 日,API 推廣價為每 100 萬 tokens:輸入 US$0.075、cached input US$0.015、輸出 US$0.25;優惠於香港時間 2026 年 9 月 9 日 24:00 結束。
- 開放權重採用 MIT License,但模型規模仍屬大型;企業選型要同時評估硬件、資料管治、工具權限、人工覆核及實際任務表現。
Z.ai 在 2026 年 8 月 26 日發布 GLM-5.3-Flash,距離文字旗艦模型 GLM-5.3 上線只有八日。名字容易令人以為只是「更快、較平」的同系列版本,但兩者並非單純大細型號關係:GLM-5.3 沿用 GLM-5.2 的 base model,再透過 post-training 提升 coding 及長任務能力;GLM-5.3-Flash 則由全新多模態 base model 開始,架構及訓練方向都以效率、視覺理解與 Agent 工作為核心。
對香港企業而言,真正值得留意的並非又多一個排行榜選項,而是市場正出現另一條可行路線:以較低 API 價格處理長 context、圖像/影片理解、程式開發及文件工作,同時保留開放權重部署選項。但模型能力、產品入口與安全執行環境是三件事,不能只看 benchmark 或「開源」兩個字便直接採用。
1. GLM-5.3-Flash 是甚麼?Ox Alpha 身份正式揭曉
GLM-5.3-Flash 是 GLM-5 系列首個原生多模態模型。Z.ai 表示,正式發布前曾以匿名名稱 ox-alpha 在 OpenCode 及 OpenRouter 測試,用真實使用量與意見觀察模型表現。因此,早前在兩個平台見過 ox-alpha 的開發者,現在可確認背後模型就是 GLM-5.3-Flash。
「Flash」在這裡主要指成本及推理效率。模型採用 Mixture-of-Experts(MoE)設計,總參數 320B,每次推理激活 18B;同時以 sparse attention 配合 linear attention,減少長 context 的計算及 KV cache 負擔。Z.ai 公布,與 GLM-5.3 相比,GLM-5.3-Flash 的 attention compute 及 KV cache size 分別減少約 3.01 倍及 4.44 倍。這些是供應商公布的架構比較,不等於任何企業工作都會得到相同比例的速度或成本改善。
模型另採用 30T-token 多模態預訓練語料,支援中英文及 1M-token context。1M context 代表一次請求可容納大量文字與多模態資料,不代表模型會自動理解所有文件、永遠不遺漏重點,亦不代表把所有公司資料一次放入去就是最佳做法。長 context 仍需要清晰任務拆解、來源標記及結果驗證。
架構計算量、KV cache 與官方 benchmark 都是理解模型的參考;企業仍要用自己的資料、工具、延遲要求與驗收準則重測,先知道實際成本及成果。
2. 原生多模態有甚麼實際分別?
GLM-5.3-Flash 的輸入可包括文字、圖片、影片及檔案,原生輸出是文字。這個界線很重要:模型可以理解截圖、畫面、錄屏、文件及影片內容,再產生分析、程式碼、修改指令或工具調用;但它本身並不是直接輸出圖片或影片的生成模型。
Z.ai 把視覺能力放入 coding loop,官方示例包括:讀取網站截圖或 screen recording、建立前端頁面、開啟結果、比較 rendering 與原稿,再繼續修正。若配合可操作瀏覽器、檔案或桌面的 Agent 環境,亦可參與 PPTX、PDF、DOCX、XLSX、研究及影片整理工作。
不過,這些成果並非單靠 model API 自動出現。模型需要一個可靠的 Harness 或 Agent 執行層,提供檔案系統、工具、權限、狀態、錯誤處理及審批。如果仍未分清 Model、Harness 與 Agent,可先閱讀 AD-Linkage 的DeepSeek Harness 架構解說。

3. GLM-5.3-Flash 與 GLM-5.3 有甚麼分別?價格相差幾多?
兩個名稱接近,但適合的測試起點不同。GLM-5.3 是 text-only 旗艦模型,重點是 complex coding、長任務及 Agent 能力;GLM-5.3-Flash 是全新多模態 base model,重點是把視覺理解、長 context 與較低服務成本放進同一模型。
| 比較項目 | GLM-5.3-Flash | GLM-5.3 |
|---|---|---|
| 發布日期 | 2026-08-26 | 2026-08-18 |
| Base model | 全新多模態 base model | 沿用 GLM-5.2 base model,以 post-training 提升 |
| 輸入/輸出 | 文字、圖片、影片、檔案輸入;文字輸出 | 文字輸入;文字輸出 |
| 模型規模 | 320B-A18B | 744B-A40B |
| Context/最高輸出 | 1M/128K tokens | 1M/128K tokens |
| Reasoning | 必須啟用;low、high、max |
必須啟用;low、high、max |
| API input(每 1M tokens) | US$0.075 推廣價;原價 US$0.15 | US$1.40 |
| API cached input(每 1M tokens) | US$0.015 推廣價;原價 US$0.03 | US$0.26 |
| API output(每 1M tokens) | US$0.25 推廣價;原價 US$0.50 | US$4.40 |
價格截點為 2026 年 8 月 28 日。GLM-5.3-Flash 的 50% API 優惠於 2026 年 9 月 9 日 24:00(UTC+8,香港時間相同)結束;以上是 Z.ai API token 價格,不等於 GLM Coding Plan 訂閱價或自行部署成本,採購前應重新核對官方價格頁。

4. Benchmark 應該點睇?先分清官方成績與企業實測
Z.ai 公布的結果顯示,GLM-5.3-Flash 在多項 coding 及 agentic benchmark 超越 GLM-5.2。例如 DeepSWE v1.1 為 63.4 對 46.2、AutomationBench 為 48.8 對 26.2;在 Z.ai 自家 Code Bench v1.0 的 max effort 測試中,GLM-5.3-Flash 得 29.0,Claude Opus 4.8 得 29.5。
上述數字全部來自 Z.ai 發布材料,並非 AD-Linkage 獨立實測。官方亦披露不同 benchmark 使用的 Agent harness、context、token 上限、timeout、sampling 及 judge model;只比較一個總分,很容易忽略執行環境對結果的影響。
企業評估時,至少要用自己的任務重新測試四項:
- 正確率:能否引用正確文件、遵守業務規則及維持計算一致?
- 完成率:面對真實工具、權限及例外時,能否完成整條工作流程?
- 成本與延遲:forced reasoning、長輸出及多輪 tool call 的實際 token 用量是多少?
- 可覆核性:人員能否看見來源、修改內容、還原操作及安全停止?
如想從更廣角度理解模型排名與真實用量的差別,可延伸閱讀2026 最多人用 5 大 LLM:OpenRouter 排名解讀。另一個值得比較的長任務模型是 Grok 4.6 的 Agent、context 與價格分析。
5. GLM-5.3-Flash 開源嗎?MIT 不等於手提電腦即可運行
GLM-5.3-Flash 權重已在 Hugging Face 提供,標示 MIT License,官方亦提供 FP8 與 BF16 版本及 SGLang、vLLM、Transformers、KTransformers、Unsloth 等部署路線。MIT License 一般容許使用、修改、發布及商業應用,但採用者仍須保留版權及許可聲明,並自行處理合規、安全與第三方資料權利。
最容易出現的誤解,是把「Flash」理解成細模型。320B 總參數、18B 激活參數仍是大型模型;MoE 只表示每次推理不會同時激活全部參數,並不會令所有權重突然消失。FP8/量化版本可以降低儲存及推理資源,但實際硬件仍取決於量化精度、context 長度、吞吐量、KV cache、並發量及部署框架。
因此,一般香港中小企不應由「下載落 laptop」開始。較穩妥的次序是:先以 API 或 Coding Plan 測試真實任務,再量度成本、質素與資料要求;只有當資料主權、延遲、批量使用或系統控制確實需要,才評估自建推理環境、雲端 GPU 或技術合作方案。
6. 香港企業可以點用?先由低風險工作建立評估基線
GLM-5.3-Flash 對香港企業的實用價值,可由三個層次理解:
- 資料理解:整理非敏感報告、產品文件、截圖、影片及會議材料,產生有來源的摘要、比較或待核對問題。
- 製作與開發:由 reference screenshot 建立頁面初稿、檢查 rendering、整理簡報/試算表內容,或為營銷及內部工具建立 prototype。
- Agent 執行:連接瀏覽器、程式碼庫、檔案與企業工具,處理多步任務;同時加入 sandbox、最小權限、操作紀錄及人工審批。
多模態輸入可能包含客戶資料、員工資料、合約、未公開產品、財務資訊或版權素材。上載前必須核對 Z.ai 當時的服務條款、資料儲存及保留安排、跨境資料要求與公司政策;若不能確認,就先用去識別化、模擬或公開資料測試。對外內容、財務分析、程式修改及 GUI 操作亦要保留人手覆核,不能把模型自信程度當成事實證據。
- 想快速驗證工作:先用 API,設定成本上限、測試集及人工評分準則。
- 主要配合 coding agent:比較 GLM Coding Plan 的實際 quota、工具相容性及團隊工作方式。
- 需要圖片、影片、文件理解:優先測試 GLM-5.3-Flash;純文字、複雜長程 coding 則把 GLM-5.3 一併放入同一測試。
- 考慮自行部署:先計算硬件、MLOps、監察、安全、升級及人力總成本,不要只看 MIT License。

結論:低價格值得測試,專業判斷仍然決定能否落地
GLM-5.3-Flash 的重要性,不只是把 token 價格壓低,而是把原生多模態、1M context、coding、工具調用與開放權重放進同一選項。這令企業更容易測試視覺 coding、文件分析及 Agent 工作,但亦令資料權限、工具安全、結果覆核與部署能力更加重要。
最合理的下一步不是立即把整間公司的資料及工具交給新模型,而是選一個可量度、可撤回、有人負責的流程:建立基準答案,限制資料與權限,比較質素、成本和失敗模式,再決定是否擴大使用。
人工智能應用績效實戰專業證書(PCPPMAI)
由多模態內容、企業知識,到 AI Agent、MCP、自動化及數據應用,學習把新模型放入可測試、可覆核的實際工作流程。
課程已列入持續進修基金可獲發還款項課程名單;實際發還視乎個人資格、CEF 餘額、修畢要求、申請程序及最新條款,並非保證獲批。
常見問題 FAQ
GLM-5.3-Flash 是甚麼?
GLM-5.3-Flash 是 Z.ai 在 2026 年 8 月 26 日發布的 GLM-5 系列首個原生多模態模型。它接受文字、圖片、影片及檔案輸入並輸出文字,支援 1M-token context、最高 128K-token 輸出、function calling、context caching 及 structured output。
GLM-5.3-Flash 就是早前的 Ox Alpha 嗎?
是。Z.ai 官方文件表示,發布前曾以 ox-alpha 名稱在 OpenCode 及 OpenRouter 匿名測試 GLM-5.3-Flash,以收集真實用戶意見。
GLM-5.3-Flash 免費嗎?
不是全面免費。Z.ai API 按 token 收費;截至 2026 年 8 月 28 日有 50% 推廣折扣,優惠於香港時間 2026 年 9 月 9 日 24:00 結束。GLM Coding Plan 另有訂閱及 quota 規則;開放權重可按 MIT License 下載,但自行部署仍有硬件、運算、儲存及技術人力成本。
GLM-5.3-Flash 可以在一般手提電腦本地運行嗎?
官方提供本地部署框架及量化版本,但 320B 總參數仍屬大型模型。一般手提電腦未必能以可接受速度、context 及穩定性運行;應先按模型精度、硬件記憶體、KV cache、吞吐量及實際工作要求評估,不要只因名稱有「Flash」便假設是輕量模型。
GLM-5.3-Flash 可以直接生成圖片或影片嗎?
GLM-5.3-Flash 原生接受圖片、影片及檔案作輸入,但模型輸出是文字。它可以產生分析、程式碼、剪輯建議或工具指令;真正建立圖片、影片、網站或 Office 文件,仍需配合相應生成工具、程式或 Agent 執行環境。
官方資料來源
- Z.ai:GLM-5.3-Flash 官方發布
- Z.ai Developer Docs:GLM-5.3-Flash 模型文件
- Z.ai Developer Docs:模型發布紀錄
- Z.ai Developer Docs:API 價格
- Z.ai Developer Docs:Core Parameters
- Z.ai:GLM-5.3 模型文件
- Z.ai GLM-5 GitHub Repository
- Hugging Face:GLM-5.3-Flash 模型與 MIT License
資料核對日期:2026 年 8 月 28 日。模型能力、API 價格、優惠、入口、權重及服務條款可能更新,採用前請再以官方頁面為準。
