Kimi K3不只是「更大模型」。它把2.8萬億參數的稀疏MoE、100萬token context、原生視覺、長程Coding與多Agent工作放進同一產品系統。AD-Linkage以多類實際任務測試K3,本文公開可供企業選型的結果,並解釋它為何能以較低API標價接近兩個最強閉源模型。
研究及價格截點:2026年7月20日|方案、配額、模型及供應狀態會變動,採購前應再次核實
五個先看結論
- K3已進入前沿級別,但不是全面第一。Artificial Analysis同一套獨立評測中,K3為57分,GPT‑5.6 Sol(max)59分,Claude Fable 5(max、含fallback)60分;Moonshot亦明確承認整體體驗仍落後兩者。
- 強項源於整套系統設計。16/896 Experts稀疏啟動、KDA、AttnRes、Stable LatentMoE、量化訓練、專家平衡、快取及分離式推理,將超大模型的容量轉成可服務的成本與長程Agent能力。
- 五項實際任務全部產出可檢視成果,但沒有一項可在首次交付後直接當作production成品。三項網站/遊戲測試都遇到Preview或部署問題;3D測試未交付真正3D模型;影片雖完成177.6秒成品,但要經多輪重剪及技術排錯。
- API標價明顯較低,但不能只看每token。K3 input/output比Sol低40%/50%,比Fable低70%/70%;不過K3在獨立評測中輸出較長,實際總任務成本未必永遠比Sol低一半。
- 個人深度使用的合理起點通常是Allegretto(US$39/月)。Moderato已可用K3,但Allegretto才解鎖100萬context、Kimi Code HighSpeed及Kimi Claw;重度Swarm才需要考慮更高方案。
先看AD-Linkage五項實驗結果
本文公開技術架構、K3/Sol/Fable比較、AD-Linkage測試結果、五級訂閱方案、API成本陷阱、Max/Swarm選擇及企業Pilot清單。
一、Kimi K3真正重要的,不只是2.8萬億參數
Moonshot於2026年7月16日推出Kimi K3,官方定位是首個接近3T級別的開放模型:2.8萬億總參數、原生視覺,以及最高100萬token context。單看「2.8T」很容易誤判成本,因為K3不是每次都動用全部參數;它採用高度稀疏的Mixture of Experts(MoE),896個專家中每次只啟動16個。
這種設計的商業意義是:模型可以保留極大的總知識與專門能力容量,同時把每一步推理的有效計算控制在遠低於2.8T全啟動模型的水平。換句話說,總參數決定「倉庫有多大」,每次啟動的Experts才較接近「每張訂單實際動用多少資源」。但MoE不是免費午餐;路由、專家負載、跨晶片通訊及記憶體仍是非常困難的工程問題。
K3六層技術組合
| 技術 | 解決甚麼問題 | 為何令K3更強/更便宜 |
|---|---|---|
| 16/896稀疏MoE | 把不同能力分配給大量專家 | 保留2.8T級容量,但每次只啟動少量Experts |
| Kimi Delta Attention(KDA) | 長序列Attention的計算與記憶體壓力 | 支援100萬context及更有效率的長程處理 |
| Attention Residuals(AttnRes) | 超深模型中資訊逐層稀釋 | 按需要選取不同深度的表示,而非一律累積 |
| Stable LatentMoE+Quantile Balancing | 超稀疏路由不穩及Experts負載不均 | 以router-score分位數分配專家,降低敏感手調參數 |
| Per-Head Muon、SiTU、Gated MLA | 大型Attention訓練與選擇性不足 | 逐Attention head優化、控制activation與資訊選擇 |
| QAT+分離式推理+快取 | 部署記憶體、通訊與重複prefill成本 | SFT起使用MXFP4 weights/MXFP8 activations,配合Mooncake及KDA prefill cache降低服務成本 |
Moonshot表示,上述架構連同新的訓練及資料配方,令K3相對K2取得約2.5倍scaling efficiency。官方亦採用balanced expert-parallel training、static shapes及critical path不作host synchronization;推理端以Mooncake分離式架構及KDA prefill cache提供服務,並稱官方API在Coding工作可取得超過90% cache hit。這些系統工程,才是K3能夠以US$3/US$15價位服務的直接原因。資料來源:Kimi K3官方Tech Blog。

K3的優勢不是單一技術,而是由模型架構、訓練、推理及Agent harness組成的完整系統。
二、為何K3已足以與GPT‑5.6 Sol及Claude Fable 5比較?
最準確的說法不是「K3已超越」,而是「K3已進入同一個企業選型討論」。Moonshot在發佈文章中直接表示,K3整體仍落後Fable 5與GPT‑5.6 Sol,但在其評測套件已呈現frontier-level performance;在長程Coding、terminal工具、視覺回饋式前端/3D開發、知識工作及研究程式化等任務尤其接近最強閉源模型。
| 模型 | AA Intelligence | Input/1M | Output/1M | 評測輸出量 |
|---|---|---|---|---|
| Claude Fable 5(max,含fallback) | 60 | US$10 | US$50 | 87M |
| GPT‑5.6 Sol(max) | 59 | US$5 | US$30 | 70M |
| Kimi K3 | 57 | US$3 | US$15 | 130M |
註:Artificial Analysis分數及用量會隨評測版本更新;Fable數據包含官方fallback機制,三個模型亦可能使用不同harness。這個表用來顯示能力與成本的量級,不代表任何單一企業任務的排名。來源:K3、GPT‑5.6 Sol、Claude Fable 5。
AD-Linkage判斷:57對59/60的差距已小至企業不能只靠總分選模型。工作類型、harness、輸出長度、重試、最後修正及風險控制,足以反轉單一排行榜的結果。
三、K3真的「至少平一半」嗎?要分標價與總任務成本
按官方API rate card比較,K3確實非常進取:cache-miss input US$3/1M、output US$15/1M;GPT‑5.6 Sol為US$5/US$30;Claude Fable 5為US$10/US$50。即是K3 input比Sol低40%、output低50%;相對Fable,input與output都低70%。
假設一項任務使用100,000個非快取input tokens及20,000個output tokens,不計工具費、稅項及重試:
這個固定token例子中,K3比Sol平約45%,比Fable平70%。但模型不會自動使用相同tokens。Artificial Analysis完整Intelligence Index的公開總成本為K3 US$2,709.75、Sol US$2,824.18、Fable US$5,630.52;K3只比Sol低約4%,但比Fable低約52%。原因是K3在該評測輸出130M tokens,明顯高於Sol的70M及Fable的87M。
真正成本=input+output+cache+工具調用+重試+等待+人工覆核,而不是只看價目表。
企業成本建議:在system prompt設定輸出長度、要求先計劃後執行、重用固定context以提高cache hit、限制Swarm與工具循環,並以「每個驗收合格交付物」而非「每百萬token」作KPI。
實際用量啟示:一輪深入評估已用 51.38% Vivace 月度額度
完成今次網站、Planner、3D、影片及長程 Agent 評估後,Vivace 帳戶介面顯示月度總用量已達51.38%,餘下48.62%,並於2026年8月17日重置。這個數字證明:高能力 Agent 工作不是「問一次、答一次」,而是反覆規劃、生成、工具調用、檢查畫面、部署、修正及重試,所以實際資源消耗可以相當明顯。
但51.38%不是token帳單。Kimi會員介面沒有提供逐項任務的token/credit ledger,因此不能把整體用量平均分配到五項任務,亦不能聲稱某一項任務單獨使用了多少token。它應被視為整輪評估的資源成本訊號。
真正的企業成本判斷:低API token標價只代表單位價格;端到端任務成本仍取決於總token量、cache hit、工具循環、重試、部署時間、人工QA及是否一次通過驗收。企業Pilot應同時記錄「tokens/credits、完成時間、重試次數、人工修正分鐘及每個合格交付物成本」,不要只比較每百萬token價格。
下載《Kimi K3 完整評測報告》
完整25頁報告包括五項任務證據矩陣、失敗模式、人工介入、51.38%用量分析、營運評分及企業採用Gate。
四、五項實驗結果:全部有成品,但全部需要人手驗收
這批測試由團隊成員親自操作,並非引用Kimi官方示範。我們刻意選擇需要程式開發、資料處理、視覺理解、檔案輸出及長時間Agent執行的任務,評估標準不是「回答得像不像」,而是有沒有交付可開啟、可操作、可驗收的成品。
結果值得同時從兩面看:K3五項測試都能由零推進至可檢視成果,證明其長程執行能力確實強;但人手驗收亦在每項測試發現足以阻礙直接發布的問題。換言之,K3很擅長把複雜任務推到「接近完成」,但不應由模型自行宣布「已完成」。
| 實驗 | 實際交付結果 | 人手驗收發現 | AD-Linkage判斷 |
|---|---|---|---|
| 世界盃比賽分析網站 | 建立並部署了完整網站介面、比賽頁及分析呈現框架。 | 首次部署版本只有外殼,實際比賽數據及分析內容不足;要經人手指出後補救。 | 前端生成快,但資料型產品必須另設內容完整性驗收。 |
| 智能行程/路線Planner | Multi-Agent模式完成可操作Planner,能整合條件、路線、選項及互動介面。 | 端到端工作接近八小時,當中接近三成時間用於部署及排錯,而非核心功能。 | 複雜產品可做到,但基建摩擦會大幅影響實際ROI。 |
| Day 1–90的3D創業遊戲 | 在數小時內建立可玩的90日進度、狀態變化、互動邏輯及3D場景原型。 | 核心遊戲完成後仍卡在Preview及部署,需額外修復才可交付。 | 由概念到複雜互動原型很強;正式上線仍需要工程驗收。 |
| 3D角色與素材生成 | 約兩小時內產出20多個可視素材,角色外觀與場景方向可供後續製作。 | 交付物並非要求中的真正.glb 3D模型;「看起來像3D」不等於可用3D資產。 |
產量高,但檔案格式與技術規格驗收不可省略。 |
| 多模態影片剪輯 | 最終輸出177.6秒完整影片,能按回饋重組片段、修正字幕及重新輸出。 | 過程需要多輪重剪及字幕校準,亦遇到記憶體不足與暫存空間問題,並非一鍵完成。 | 可作持續執行的AI剪輯協作者,但仍需要人作導演與最後QC。 |

五項測試全部有可檢視成果,但首次交付均未能直接作production成品。
最重要的實測結論
- K3最有說服力的能力不是單次回答,而是五項不同任務都能在多輪、工具及檔案之間持續推進,產出可被檢查的成果。
- 原生視覺令「看畫面→修改程式→再看結果」成為閉環,對前端、3D及視覺化工作特別有用。
- Swarm的效益取決於任務可否真正平行;高度相依的工序會把節省的時間轉成整合成本。
- K3可以大幅加速第一個可用版本,但五項測試均需要人手指出問題或完成最後修正;「可見成果」與「可正式部署/發布」之間仍有明確距離。
披露界線:本文公開測試種類、評估維度、結果級別及企業含意;完整測試設計、原始prompts、逐步過程、失敗修正、畫面與成品細節,保留給 @thefirstdripai 的個人內容。
五、Kimi五級訂閱方案比較:應該由哪一級開始?
Kimi會員月費與API token計費是兩種不同使用路徑。會員方案主要覆蓋Kimi Agent、Swarm、Kimi Code與平台功能;企業系統整合則通常要另外評估API用量、合約及帳戶安排。以下按官方2026年7月20日價目整理,Agent credits為按典型耗用推算的約數。
| 方案 | 月費 | 年繳月均 | Agent/Swarm | Kimi Code | 適合誰 |
|---|---|---|---|---|---|
| Adagio | 免費 | — | 約6/無Swarm | — | 熟習介面;不是K3正式測試方案 |
| Moderato | US$19 | US$15 | 約60/25次 | 1× | 最低成本試K3、輕量Agent工作 |
| Allegretto | US$39 | US$31 | 約150/50次 | 5×+HighSpeed | 認真使用首選:1M context、Kimi Claw |
| Allegro | US$99 | US$79 | 約360/120次 | 15× | 高頻個人/小隊,4個Agent並行 |
| Vivace | US$199 | US$159 | 約720/240次 | 30× | 重度Swarm、8個Swarm subtasks並行 |
官方亦列出Agent並行數、專業資料庫調用及Kimi Claw等差異。Moderato或以上可用K3;Allegretto或以上才解鎖100萬context,Kimi Code HighSpeed約為Standard輸出速度5–6倍,但使用同一模型。來源:Kimi會員價格及Kimi Code更新紀錄。
AD-Linkage選擇建議:只想驗證K3能力可先用Moderato;要處理大型codebase、長文件或把Kimi Code作日常工具,Allegretto較合理;Allegro/Vivace應由真實credits消耗、並行需求及節省的人手時間支持,而不是因「最高級」而購買。
六、K3 Max、K3 Swarm、Kimi Code與API怎樣選?
| 使用方式 | 最適合 | 不要用在 |
|---|---|---|
| K3 Low/High/Max | 同一任務調整推理深度;Max用於困難debug、長程研究及高複雜分析 | 簡短改寫及沒有明確成功標準的工作 |
| K3 Swarm | 大量搜尋、批量資料、獨立章節、可平行開發/QA | 步驟互相依賴、共享資料定義未凍結的工作 |
| Kimi Code | repository、terminal、IDE、測試、檔案與長時間程式工作 | 沒有版本控制、測試及權限邊界的production環境 |
| Kimi API | 產品整合、批量流程、模型路由、成本與日誌控制 | 沒有監控、用量上限、fallback及人工升級機制的自動行動 |
K3 Swarm官方架構最多可協調300個sub-agents、每項任務超過4,000次工具調用;官方稱大型搜尋可比single-agent快約4.5倍,但亦明確表示Swarm消耗顯著較多credits。真正重點不是Agents數量,而是orchestrator能否把任務拆成互不踩線的工作、維持共享schema,再正確整合結果。來源:Kimi Agent Swarm官方說明。

Max是同一模型的較高推理投入;Swarm是由多個Agents分工協作,兩者不是同一概念。
七、K3仍有哪些不可忽略的限制?
- Thinking history兼容:官方提醒,若harness沒有完整傳回歷史thinking,或在同一session中途轉入K3,品質可能不穩;Kimi Code亦建議切換模型後開新session。
- 過度主動:K3為長程任務訓練,在意圖含糊時可能替用戶作出未授權決定;system prompt/AGENTS.md需要寫清楚禁止行為、停手及批准條件。
- 輸出冗長與速度:獨立測試顯示K3輸出量高、速度低於另外兩個比較模型;低單價可能被更多output及等待時間抵消。
- 前沿模型不等於完整產品:部署、身份、資料治理、連接器、審計、SLA與UX同樣影響企業價值。
- 自建門檻極高:Moonshot建議使用64個或以上accelerators的supernode;開放權重不代表大部分香港企業自行部署會更便宜。
八、AD-Linkage給企業的採用建議
- 用真實但可逆的任務做Pilot:不要用demo prompt;選擇每週重複、答案可核對、錯誤可被發現的工作。
- 同一任務比較三個模型:固定輸入、工具、完成標準及輸出長度,分別記錄首次通過率、時間、token、重試及人工修正。
- 先High,遇到瓶頸才Max或Swarm:只有推理不足才升Max;只有工作真正可平行才開Swarm。
- 以交付物總成本衡量:模型費只是其中一項,要連工具費、等待、覆核、重做與失敗風險一併計算。
- 保留模型路由:K3可作高性價比長程工作候選;Fable或Sol可留作最困難、最需要特定harness或最重視端到端體驗的工作。
建議五項Pilot KPI
首次通過率|人手覆核分鐘|端到端完成時間|每個合格交付物總成本|有證據/測試支持比例
結論:K3的真正衝擊,是把前沿能力帶到新的價格帶
K3沒有在所有維度超越Fable 5或GPT‑5.6 Sol。它的UX、速度、輸出控制與若干高難度任務仍有差距。但57對59/60的獨立能力分數,加上更低API rate card、原生視覺、100萬context、開放權重方向及完整Agent產品,已令它不能再被視為「次一級便宜模型」。
它之所以強,不是因為把2.8T直接堆上去,而是Moonshot以稀疏MoE、KDA、AttnRes、穩定路由、量化、分離式推理及快取,把巨大容量轉成可用的長程工作能力。它之所以便宜,亦不是模型計算沒有成本,而是每次稀疏啟動、低精度部署、cache及基建設計共同降低服務成本。
對香港企業,最合理的結論是:把K3加入候選名單,利用它降低高複雜任務的試驗成本,但用真實Pilot證明每個合格交付物的總成本與風險。
由比較模型,進一步建立可管治的AI工作流程
AD-Linkage「人工智能應用績效實戰專業證書(PCPPMAI)」涵蓋Agentic AI、MCP、主流AI平台比較、Vibe Coding及多模態應用。課程已列入持續進修基金可獲發還款項課程名單;實際資助及入讀資格以最新條款為準。
常見問題
Kimi K3是否強過GPT‑5.6 Sol與Claude Fable 5?
不能概括說全面更強。獨立Artificial Analysis評測中K3為57分,Sol為59分,Fable為60分;Moonshot亦承認整體仍有差距。但K3在長程Coding、原生視覺、互動創作及Agent工作已具前沿競爭力。
為何K3的價格可以低很多?
核心包括16/896 Experts稀疏啟動、KDA、Stable LatentMoE、MXFP4/MXFP8量化訓練、balanced expert-parallel、Mooncake分離式推理與高cache hit。它以系統效率換取較低服務價格,而不是每次都運行全部2.8T參數。
K3是否真的比Sol平一半?
按rate card,K3 output價格是Sol的一半,input低40%;但實際任務成本受輸出長度、cache、重試及工具調用影響。獨立評測中K3因輸出較長,完整評測總成本只比Sol低約4%,所以企業必須按交付物量度。
哪個Kimi訂閱方案最值得開始?
Moderato(US$19/月)是使用K3的最低級別;若要100萬context、Kimi Code HighSpeed及Kimi Claw,Allegretto(US$39/月)通常是較合理起點。更高方案應由實際credits及並行需要支持。
AD-Linkage測試K3得到甚麼結果?
五項測試全部產出可檢視成果,但首次交付沒有一項可直接當作production成品。世界盃分析網站首次部署缺少實際數據與分析;行程Planner接近三成時間花在部署排錯;Day 1–90遊戲要修復Preview/部署;3D測試產出20多個素材但不是要求的.glb模型;影片最終完成177.6秒成品,但需多輪重剪、字幕校準及技術排錯。
會員月費是否包括Kimi API用量?
會員與API應視為不同使用及計費路徑。會員表列Agent、Swarm及Kimi Code credits;API則按tokens計費。企業整合前應在相應帳戶再次核實結算、配額及合約安排。
主要資料來源
- Kimi K3官方Tech Blog:架構、訓練、推理、能力、價格、benchmark註解及限制。
- Kimi會員價格:五級方案、月/年費、Agent/Swarm/Code配額。
- Kimi Code更新紀錄:K3開放級別、1M context及HighSpeed。
- Kimi Agent Swarm官方說明:架構、平台上限、credits及PARL。
- OpenAI GPT‑5.6 Sol官方模型頁:context與API價格。
- Anthropic Claude Fable 5官方發佈:能力、價格、fallback及資料保留政策。
- Artificial Analysis:Kimi K3、GPT‑5.6 Sol、Claude Fable 5:同一獨立評測框架下的能力、速度、價格、tokens與總成本。
