AD-Linkage Kimi K3企業實測:五項真實任務與K3 Max、K3 Swarm能力分析

Kimi K3為何可挑戰GPT‑5.6 Sol與Claude Fable 5?技術、實測、價格及訂閱方案全解析

AD-Linkage Limited · FRONTIER AI ANALYSIS

Kimi K3不只是「更大模型」。它把2.8萬億參數的稀疏MoE、100萬token context、原生視覺、長程Coding與多Agent工作放進同一產品系統。AD-Linkage以多類實際任務測試K3,本文公開可供企業選型的結果,並解釋它為何能以較低API標價接近兩個最強閉源模型。

研究及價格截點:2026年7月20日|方案、配額、模型及供應狀態會變動,採購前應再次核實

五個先看結論

  • K3已進入前沿級別,但不是全面第一。Artificial Analysis同一套獨立評測中,K3為57分,GPT‑5.6 Sol(max)59分,Claude Fable 5(max、含fallback)60分;Moonshot亦明確承認整體體驗仍落後兩者。
  • 強項源於整套系統設計。16/896 Experts稀疏啟動、KDA、AttnRes、Stable LatentMoE、量化訓練、專家平衡、快取及分離式推理,將超大模型的容量轉成可服務的成本與長程Agent能力。
  • 五項實際任務全部產出可檢視成果,但沒有一項可在首次交付後直接當作production成品。三項網站/遊戲測試都遇到Preview或部署問題;3D測試未交付真正3D模型;影片雖完成177.6秒成品,但要經多輪重剪及技術排錯。
  • API標價明顯較低,但不能只看每token。K3 input/output比Sol低40%/50%,比Fable低70%/70%;不過K3在獨立評測中輸出較長,實際總任務成本未必永遠比Sol低一半。
  • 個人深度使用的合理起點通常是Allegretto(US$39/月)。Moderato已可用K3,但Allegretto才解鎖100萬context、Kimi Code HighSpeed及Kimi Claw;重度Swarm才需要考慮更高方案。

先看AD-Linkage五項實驗結果

本文公開技術架構、K3/Sol/Fable比較、AD-Linkage測試結果、五級訂閱方案、API成本陷阱、Max/Swarm選擇及企業Pilot清單。

直接查看五項實驗結果

一、Kimi K3真正重要的,不只是2.8萬億參數

Moonshot於2026年7月16日推出Kimi K3,官方定位是首個接近3T級別的開放模型:2.8萬億總參數、原生視覺,以及最高100萬token context。單看「2.8T」很容易誤判成本,因為K3不是每次都動用全部參數;它採用高度稀疏的Mixture of Experts(MoE),896個專家中每次只啟動16個。

這種設計的商業意義是:模型可以保留極大的總知識與專門能力容量,同時把每一步推理的有效計算控制在遠低於2.8T全啟動模型的水平。換句話說,總參數決定「倉庫有多大」,每次啟動的Experts才較接近「每張訂單實際動用多少資源」。但MoE不是免費午餐;路由、專家負載、跨晶片通訊及記憶體仍是非常困難的工程問題。

K3六層技術組合

技術 解決甚麼問題 為何令K3更強/更便宜
16/896稀疏MoE 把不同能力分配給大量專家 保留2.8T級容量,但每次只啟動少量Experts
Kimi Delta Attention(KDA) 長序列Attention的計算與記憶體壓力 支援100萬context及更有效率的長程處理
Attention Residuals(AttnRes) 超深模型中資訊逐層稀釋 按需要選取不同深度的表示,而非一律累積
Stable LatentMoE+Quantile Balancing 超稀疏路由不穩及Experts負載不均 以router-score分位數分配專家,降低敏感手調參數
Per-Head Muon、SiTU、Gated MLA 大型Attention訓練與選擇性不足 逐Attention head優化、控制activation與資訊選擇
QAT+分離式推理+快取 部署記憶體、通訊與重複prefill成本 SFT起使用MXFP4 weights/MXFP8 activations,配合Mooncake及KDA prefill cache降低服務成本

Moonshot表示,上述架構連同新的訓練及資料配方,令K3相對K2取得約2.5倍scaling efficiency。官方亦採用balanced expert-parallel training、static shapes及critical path不作host synchronization;推理端以Mooncake分離式架構及KDA prefill cache提供服務,並稱官方API在Coding工作可取得超過90% cache hit。這些系統工程,才是K3能夠以US$3/US$15價位服務的直接原因。資料來源:Kimi K3官方Tech Blog

Kimi K3發布日期、2.8萬億參數、100萬token context及原生視覺能力重點

K3的優勢不是單一技術,而是由模型架構、訓練、推理及Agent harness組成的完整系統。

二、為何K3已足以與GPT‑5.6 Sol及Claude Fable 5比較?

最準確的說法不是「K3已超越」,而是「K3已進入同一個企業選型討論」。Moonshot在發佈文章中直接表示,K3整體仍落後Fable 5與GPT‑5.6 Sol,但在其評測套件已呈現frontier-level performance;在長程Coding、terminal工具、視覺回饋式前端/3D開發、知識工作及研究程式化等任務尤其接近最強閉源模型。

模型 AA Intelligence Input/1M Output/1M 評測輸出量
Claude Fable 5(max,含fallback) 60 US$10 US$50 87M
GPT‑5.6 Sol(max) 59 US$5 US$30 70M
Kimi K3 57 US$3 US$15 130M

註:Artificial Analysis分數及用量會隨評測版本更新;Fable數據包含官方fallback機制,三個模型亦可能使用不同harness。這個表用來顯示能力與成本的量級,不代表任何單一企業任務的排名。來源:K3GPT‑5.6 SolClaude Fable 5

AD-Linkage判斷:57對59/60的差距已小至企業不能只靠總分選模型。工作類型、harness、輸出長度、重試、最後修正及風險控制,足以反轉單一排行榜的結果。

三、K3真的「至少平一半」嗎?要分標價與總任務成本

按官方API rate card比較,K3確實非常進取:cache-miss input US$3/1M、output US$15/1M;GPT‑5.6 Sol為US$5/US$30;Claude Fable 5為US$10/US$50。即是K3 input比Sol低40%、output低50%;相對Fable,input與output都低70%。

假設一項任務使用100,000個非快取input tokens及20,000個output tokens,不計工具費、稅項及重試:

Kimi K3

US$0.60
0.1×3+0.02×15
GPT‑5.6 Sol

US$1.10
0.1×5+0.02×30
Claude Fable 5

US$2.00
0.1×10+0.02×50

這個固定token例子中,K3比Sol平約45%,比Fable平70%。但模型不會自動使用相同tokens。Artificial Analysis完整Intelligence Index的公開總成本為K3 US$2,709.75、Sol US$2,824.18、Fable US$5,630.52;K3只比Sol低約4%,但比Fable低約52%。原因是K3在該評測輸出130M tokens,明顯高於Sol的70M及Fable的87M。

真正成本=input+output+cache+工具調用+重試+等待+人工覆核,而不是只看價目表。

企業成本建議:在system prompt設定輸出長度、要求先計劃後執行、重用固定context以提高cache hit、限制Swarm與工具循環,並以「每個驗收合格交付物」而非「每百萬token」作KPI。

REAL USAGE SIGNAL

實際用量啟示:一輪深入評估已用 51.38% Vivace 月度額度

完成今次網站、Planner、3D、影片及長程 Agent 評估後,Vivace 帳戶介面顯示月度總用量已達51.38%,餘下48.62%,並於2026年8月17日重置。這個數字證明:高能力 Agent 工作不是「問一次、答一次」,而是反覆規劃、生成、工具調用、檢查畫面、部署、修正及重試,所以實際資源消耗可以相當明顯。

51.38%
帳戶月度總用量
48.62%
截圖時剩餘用量
2026-08-17
月度額度重置

但51.38%不是token帳單。Kimi會員介面沒有提供逐項任務的token/credit ledger,因此不能把整體用量平均分配到五項任務,亦不能聲稱某一項任務單獨使用了多少token。它應被視為整輪評估的資源成本訊號。

真正的企業成本判斷:低API token標價只代表單位價格;端到端任務成本仍取決於總token量、cache hit、工具循環、重試、部署時間、人工QA及是否一次通過驗收。企業Pilot應同時記錄「tokens/credits、完成時間、重試次數、人工修正分鐘及每個合格交付物成本」,不要只比較每百萬token價格。

FREE FULL REPORT

下載《Kimi K3 完整評測報告》

完整25頁報告包括五項任務證據矩陣、失敗模式、人工介入、51.38%用量分析、營運評分及企業採用Gate。

免費下載完整PDF報告

四、五項實驗結果:全部有成品,但全部需要人手驗收

這批測試由團隊成員親自操作,並非引用Kimi官方示範。我們刻意選擇需要程式開發、資料處理、視覺理解、檔案輸出及長時間Agent執行的任務,評估標準不是「回答得像不像」,而是有沒有交付可開啟、可操作、可驗收的成品

結果值得同時從兩面看:K3五項測試都能由零推進至可檢視成果,證明其長程執行能力確實強;但人手驗收亦在每項測試發現足以阻礙直接發布的問題。換言之,K3很擅長把複雜任務推到「接近完成」,但不應由模型自行宣布「已完成」。

5/5
產出可檢視成果
3/3
網站/遊戲遇到Preview或部署問題
0/5
首次交付可直接作production成品
實驗 實際交付結果 人手驗收發現 AD-Linkage判斷
世界盃比賽分析網站 建立並部署了完整網站介面、比賽頁及分析呈現框架。 首次部署版本只有外殼,實際比賽數據及分析內容不足;要經人手指出後補救。 前端生成快,但資料型產品必須另設內容完整性驗收。
智能行程/路線Planner Multi-Agent模式完成可操作Planner,能整合條件、路線、選項及互動介面。 端到端工作接近八小時,當中接近三成時間用於部署及排錯,而非核心功能。 複雜產品可做到,但基建摩擦會大幅影響實際ROI。
Day 1–90的3D創業遊戲 在數小時內建立可玩的90日進度、狀態變化、互動邏輯及3D場景原型。 核心遊戲完成後仍卡在Preview及部署,需額外修復才可交付。 由概念到複雜互動原型很強;正式上線仍需要工程驗收。
3D角色與素材生成 約兩小時內產出20多個可視素材,角色外觀與場景方向可供後續製作。 交付物並非要求中的真正.glb 3D模型;「看起來像3D」不等於可用3D資產。 產量高,但檔案格式與技術規格驗收不可省略。
多模態影片剪輯 最終輸出177.6秒完整影片,能按回饋重組片段、修正字幕及重新輸出。 過程需要多輪重剪及字幕校準,亦遇到記憶體不足與暫存空間問題,並非一鍵完成。 可作持續執行的AI剪輯協作者,但仍需要人作導演與最後QC。

Kimi K3五項企業任務實測結果及主要交付風險

五項測試全部有可檢視成果,但首次交付均未能直接作production成品。

最重要的實測結論

  • K3最有說服力的能力不是單次回答,而是五項不同任務都能在多輪、工具及檔案之間持續推進,產出可被檢查的成果。
  • 原生視覺令「看畫面→修改程式→再看結果」成為閉環,對前端、3D及視覺化工作特別有用。
  • Swarm的效益取決於任務可否真正平行;高度相依的工序會把節省的時間轉成整合成本。
  • K3可以大幅加速第一個可用版本,但五項測試均需要人手指出問題或完成最後修正;「可見成果」與「可正式部署/發布」之間仍有明確距離。

披露界線:本文公開測試種類、評估維度、結果級別及企業含意;完整測試設計、原始prompts、逐步過程、失敗修正、畫面與成品細節,保留給 @thefirstdripai 的個人內容。

五、Kimi五級訂閱方案比較:應該由哪一級開始?

Kimi會員月費與API token計費是兩種不同使用路徑。會員方案主要覆蓋Kimi Agent、Swarm、Kimi Code與平台功能;企業系統整合則通常要另外評估API用量、合約及帳戶安排。以下按官方2026年7月20日價目整理,Agent credits為按典型耗用推算的約數。

方案 月費 年繳月均 Agent/Swarm Kimi Code 適合誰
Adagio 免費 約6/無Swarm 熟習介面;不是K3正式測試方案
Moderato US$19 US$15 約60/25次 最低成本試K3、輕量Agent工作
Allegretto US$39 US$31 約150/50次 5×+HighSpeed 認真使用首選:1M context、Kimi Claw
Allegro US$99 US$79 約360/120次 15× 高頻個人/小隊,4個Agent並行
Vivace US$199 US$159 約720/240次 30× 重度Swarm、8個Swarm subtasks並行

官方亦列出Agent並行數、專業資料庫調用及Kimi Claw等差異。Moderato或以上可用K3;Allegretto或以上才解鎖100萬context,Kimi Code HighSpeed約為Standard輸出速度5–6倍,但使用同一模型。來源:Kimi會員價格Kimi Code更新紀錄

AD-Linkage選擇建議:只想驗證K3能力可先用Moderato;要處理大型codebase、長文件或把Kimi Code作日常工具,Allegretto較合理;Allegro/Vivace應由真實credits消耗、並行需求及節省的人手時間支持,而不是因「最高級」而購買。

六、K3 Max、K3 Swarm、Kimi Code與API怎樣選?

使用方式 最適合 不要用在
K3 Low/High/Max 同一任務調整推理深度;Max用於困難debug、長程研究及高複雜分析 簡短改寫及沒有明確成功標準的工作
K3 Swarm 大量搜尋、批量資料、獨立章節、可平行開發/QA 步驟互相依賴、共享資料定義未凍結的工作
Kimi Code repository、terminal、IDE、測試、檔案與長時間程式工作 沒有版本控制、測試及權限邊界的production環境
Kimi API 產品整合、批量流程、模型路由、成本與日誌控制 沒有監控、用量上限、fallback及人工升級機制的自動行動

K3 Swarm官方架構最多可協調300個sub-agents、每項任務超過4,000次工具調用;官方稱大型搜尋可比single-agent快約4.5倍,但亦明確表示Swarm消耗顯著較多credits。真正重點不是Agents數量,而是orchestrator能否把任務拆成互不踩線的工作、維持共享schema,再正確整合結果。來源:Kimi Agent Swarm官方說明

K3 Max Thinking Effort與K3 Swarm Multi-Agent模式比較

Max是同一模型的較高推理投入;Swarm是由多個Agents分工協作,兩者不是同一概念。

七、K3仍有哪些不可忽略的限制?

  1. Thinking history兼容:官方提醒,若harness沒有完整傳回歷史thinking,或在同一session中途轉入K3,品質可能不穩;Kimi Code亦建議切換模型後開新session。
  2. 過度主動:K3為長程任務訓練,在意圖含糊時可能替用戶作出未授權決定;system prompt/AGENTS.md需要寫清楚禁止行為、停手及批准條件。
  3. 輸出冗長與速度:獨立測試顯示K3輸出量高、速度低於另外兩個比較模型;低單價可能被更多output及等待時間抵消。
  4. 前沿模型不等於完整產品:部署、身份、資料治理、連接器、審計、SLA與UX同樣影響企業價值。
  5. 自建門檻極高:Moonshot建議使用64個或以上accelerators的supernode;開放權重不代表大部分香港企業自行部署會更便宜。

八、AD-Linkage給企業的採用建議

  1. 用真實但可逆的任務做Pilot:不要用demo prompt;選擇每週重複、答案可核對、錯誤可被發現的工作。
  2. 同一任務比較三個模型:固定輸入、工具、完成標準及輸出長度,分別記錄首次通過率、時間、token、重試及人工修正。
  3. 先High,遇到瓶頸才Max或Swarm:只有推理不足才升Max;只有工作真正可平行才開Swarm。
  4. 以交付物總成本衡量:模型費只是其中一項,要連工具費、等待、覆核、重做與失敗風險一併計算。
  5. 保留模型路由:K3可作高性價比長程工作候選;Fable或Sol可留作最困難、最需要特定harness或最重視端到端體驗的工作。

建議五項Pilot KPI

首次通過率|人手覆核分鐘|端到端完成時間|每個合格交付物總成本|有證據/測試支持比例

結論:K3的真正衝擊,是把前沿能力帶到新的價格帶

K3沒有在所有維度超越Fable 5或GPT‑5.6 Sol。它的UX、速度、輸出控制與若干高難度任務仍有差距。但57對59/60的獨立能力分數,加上更低API rate card、原生視覺、100萬context、開放權重方向及完整Agent產品,已令它不能再被視為「次一級便宜模型」。

它之所以強,不是因為把2.8T直接堆上去,而是Moonshot以稀疏MoE、KDA、AttnRes、穩定路由、量化、分離式推理及快取,把巨大容量轉成可用的長程工作能力。它之所以便宜,亦不是模型計算沒有成本,而是每次稀疏啟動、低精度部署、cache及基建設計共同降低服務成本。

對香港企業,最合理的結論是:把K3加入候選名單,利用它降低高複雜任務的試驗成本,但用真實Pilot證明每個合格交付物的總成本與風險。

AD-Linkage Limited · PRACTICAL AI LEARNING

由比較模型,進一步建立可管治的AI工作流程

AD-Linkage「人工智能應用績效實戰專業證書(PCPPMAI)」涵蓋Agentic AI、MCP、主流AI平台比較、Vibe Coding及多模態應用。課程已列入持續進修基金可獲發還款項課程名單;實際資助及入讀資格以最新條款為準。

常見問題

Kimi K3是否強過GPT‑5.6 Sol與Claude Fable 5?

不能概括說全面更強。獨立Artificial Analysis評測中K3為57分,Sol為59分,Fable為60分;Moonshot亦承認整體仍有差距。但K3在長程Coding、原生視覺、互動創作及Agent工作已具前沿競爭力。

為何K3的價格可以低很多?

核心包括16/896 Experts稀疏啟動、KDA、Stable LatentMoE、MXFP4/MXFP8量化訓練、balanced expert-parallel、Mooncake分離式推理與高cache hit。它以系統效率換取較低服務價格,而不是每次都運行全部2.8T參數。

K3是否真的比Sol平一半?

按rate card,K3 output價格是Sol的一半,input低40%;但實際任務成本受輸出長度、cache、重試及工具調用影響。獨立評測中K3因輸出較長,完整評測總成本只比Sol低約4%,所以企業必須按交付物量度。

哪個Kimi訂閱方案最值得開始?

Moderato(US$19/月)是使用K3的最低級別;若要100萬context、Kimi Code HighSpeed及Kimi Claw,Allegretto(US$39/月)通常是較合理起點。更高方案應由實際credits及並行需要支持。

AD-Linkage測試K3得到甚麼結果?

五項測試全部產出可檢視成果,但首次交付沒有一項可直接當作production成品。世界盃分析網站首次部署缺少實際數據與分析;行程Planner接近三成時間花在部署排錯;Day 1–90遊戲要修復Preview/部署;3D測試產出20多個素材但不是要求的.glb模型;影片最終完成177.6秒成品,但需多輪重剪、字幕校準及技術排錯。

會員月費是否包括Kimi API用量?

會員與API應視為不同使用及計費路徑。會員表列Agent、Swarm及Kimi Code credits;API則按tokens計費。企業整合前應在相應帳戶再次核實結算、配額及合約安排。

主要資料來源

相關內容