Grok 4.6 長任務 AI Agent 正式進入實戰期:功能、價格及香港企業選型

Grok 4.6 正式發布:長時 AI Agent、500K Context、定價及香港企業選型

懶人包(TL;DR)

  • 核心升級是長任務能力。Grok 4.6 主打長時間、多步驟的研究、分析、程式開發及互動產品製作,而非單純令聊天答案更長。
  • Context 沒有加大。API context window 仍為 500,000 tokens;它支援文字及圖片輸入、文字輸出、工具調用及可調式 reasoning effort。
  • 官方數據顯示明顯進步,但並非全面勝出。Grok 4.6 在 AA Intelligence Index 得 61,與 GPT-5.6 Sol 同分;在部分知識工作及 coding 測試領先,在 DeepSWE 及 Terminal-Bench 則落後。
  • 未快取的 API 標準價與 Grok 4.5 相同。少於 200K prompt 時,每百萬 input/output tokens 為 US$2/US$6;達 200K 或以上後,整個請求按 US$4/US$12 計算。Cached input 則由 Grok 4.5 的 US$0.30 加至 US$0.50。
  • 首星期優惠不是免費任用。Grok Build 及 Cursor 提供 2 倍 included usage,但官方沒有公布無限免費額度或確實截止時間。

SpaceXAI 在推出 Grok 4.5 約一個月後,再於 8 月 12 日發布 Grok 4.6。這次升級最值得留意的並非又一輪榜單數字,而是模型能否在多個步驟之間維持目標、檢查自己的工作,再把一個概念逐步變成可用成果。

對香港企業而言,這比「哪個模型答題最高分」更實際。當 AI 開始接觸研究、程式碼、報告、工作流程甚至外部工具,真正成本包括 Token、人工覆核、錯誤修正及權限風險,而不只是月費。

1. Grok 4.6 的重點:由回答問題變成持續完成工作

官方把 Grok 4.6 定位為 coding、agentic tasks 及 knowledge work 的前沿模型,特別強調 long-running agents。它希望處理的不是一次對話,而是以下長軌跡工作:

  • 研究陌生主題並整理證據;
  • 分析資料後持續修改結論;
  • 跨越整個 codebase 進行程式開發;
  • 由產品概念建立互動應用或工作成果;
  • 根據多輪回饋測試、驗證及繼續迭代。

SpaceXAI 表示,在較長任務中觀察到 Grok 4.6 有更多自我測試和驗證行為,對視覺及互動式項目的第一版亦較 Grok 4.5 完整。不過這仍是供應商發布時的觀察,企業應以自己的真實任務重測,而不是直接當作穩定成果保證。

Grok 4.6 三項升級重點:長任務持續執行、更多自我測試及更完整的互動項目首版

2. 規格沒有大改,訓練方向才是關鍵

官方模型文件列出的 Grok 4.6 API context window 是 500K tokens,與 Grok 4.5 相同。它接受文字及圖片輸入並輸出文字,支援 function calling、structured outputs 及 reasoning;開發者亦可配合 Web Search、X Search、Code Execution 與其他工具建立 Agent。

今次提升主要來自較長的補充訓練、經篩選的模型生成推理與技術資料、高質素工程資料、改良 optimizer,以及針對知識工作、一般 coding、web development、CAD 等場景的 agentic reinforcement learning。

關鍵結論:Grok 4.6 的賣點不是「塞入更多文件」,而是嘗試在同一個長任務內更有效地規劃、執行和驗證。500K context 仍然很大,但 context 長度從來不等於模型能正確使用所有內容。

3. Benchmark 點睇?同 GPT-5.6 Sol 有輸有贏

SpaceXAI 公布的發布數據顯示,Grok 4.6 High 在 AA Intelligence Index 由 Grok 4.5 的 56 升至 61,與 GPT-5.6 Sol Max 同分。它在 GDPVal-AA v2、CursorBench 3.2、FrontierCode 1.1、APEX-Agents 及 AA-Briefcase 的表列成績高於 GPT-5.6 Sol;但 DeepSWE 1.1 及 Terminal-Bench 3.0 則由 GPT-5.6 Sol 領先。

所以較準確的結論是:Grok 4.6 已重返前沿模型梯隊,但不是在所有工作全面超越 GPT-5.6 Sol 或 Claude Fable 5。

官方亦註明,競品數字取自各開發商公開 system cards 或 leaderboard 的最佳結果。不同模型可能使用不同 reasoning effort、Agent harness、工具及測試設定,因此不應把這組數字當成完全受控的 head-to-head 實驗。想了解另一條模型路線,可參考 AD-Linkage 的 GPT-5.6 Sol、Terra、Luna 企業應用分析

Grok 4.6、Grok 4.5 與 GPT-5.6 Sol 的官方發布數據比較

4. Grok 4.6 價格、免費使用及香港用戶如何取得

Grok 4.6 已在 Grok Build、Cursor、SpaceXAI API、OpenRouter、Vercel 及 Cloudflare 提供。官方個人方案頁亦列明,US$30/月的 SuperGrok 包含 Grok 4.6;免費方案雖然可以使用 Grok 的部分功能,但官方沒有清楚承諾免費方案可用多少 Grok 4.6 額度。

發布首星期,Grok Build 及 Cursor 提供 2 倍 included usage。這代表指定服務內的包含用量增加,不代表 API 免費、無限任用,亦不代表所有 Grok 介面都享有同一優惠。

API 的標準文字價格如下。當中未快取 input 及 output 價格與 Grok 4.5 相同,但 cached input 由每百萬 tokens US$0.30 調升至 US$0.50:

Prompt 範圍 Input / 1M tokens Cached input / 1M Output / 1M tokens
少於 200K tokens US$2 US$0.50 US$6
200K 至 500K tokens US$4 US$1 US$12
成本提醒:當 prompt 達到 200K tokens,整個請求都按 long-context 價格計算,而不是只有超出部分加價。Web Search、X Search 及 Code Execution 亦各自收取每 1,000 次 US$5,再加模型 Token 費用。大量文件不應無差別全部放入 prompt;先檢索、摘要和分段處理,往往更容易控制成本及準確度。

5. 香港企業應否採用?先做一個可驗收的 Pilot

Grok 4.6 特別適合測試三類工作:

  1. 程式及數碼產品:修正跨檔案問題、建立內部工具、Dashboard 或互動原型;
  2. 長篇研究與知識工作:整合多個來源、產出有引用的比較及分析初稿;
  3. Agent 工作流程:結合搜尋、程式執行或企業工具,持續完成多步任務。

但試用時應保留四個控制:先選一個真實而範圍清楚的任務、移除敏感資料、在所有對外操作前加入人工審批,以及同時量度品質、時間、Token 和覆核成本。這亦是 AI Agent 由對話走向工作流程 時最容易被忽略的一環。

香港企業試用 Grok 4.6 的四步流程:選任務、資料脫敏、人工檢查及量度結果
資料管治提醒:SpaceXAI 官方文件指出,API 輸入及輸出在未獲明確許可下不會用作訓練,但預設會加密保存 30 日作濫用審核。企業可以考慮 Zero Data Retention,但啟用後會失去部分依賴儲存的功能,包括 stateful Responses API、Files、Collections 及 Batch API。因此,機密資料、個人資料及客戶資料仍應先進行分類和權限評估。

6. 結論:Grok 4.6 值得試,但應以任務而非品牌選模型

Grok 4.6 的真正訊號,是前沿模型競爭正在由「單次回答更聰明」轉向「能否長時間完成、檢查及交付工作」。它在多項知識工作和 coding 測試進步明顯,未快取 input 及 output 的標準 API 價格亦保持在 Grok 4.5 水平,值得需要長任務、Vibe Coding 或 Agent 流程的團隊納入實測。

但企業不應因為一個綜合分數便全面轉換平台。最合理做法,是用同一份任務、相同資料和驗收準則,同時測試 Grok 4.6 及現有模型,再比較可接受成果的總成本。

將模型新聞變成真正工作能力

PCPPMAI AI 實戰課程

AD-Linkage 的「人工智能應用績效實戰專業證書(PCPPMAI)」不只介紹單一 AI 工具,而是透過 Prompt Engineering、RAG、AI Agent、MCP、n8n、Vibe Coding 及跨平台比較,教授如何選擇模型、設定驗收方式,並把 AI 應用到實際工作流程。

課程已列入持續進修基金可獲發還款項課程名單。實際發還視乎個人資格、CEF 餘額、修畢要求、申請程序及最新條款,並非保證獲批。

常見問題 FAQ

Grok 3.6 是否真的存在?

截至 2026 年 8 月 13 日,SpaceXAI 官方新聞、模型文件及價格頁都沒有 Grok 3.6。最新正式發布版本是 Grok 4.6。

Grok 4.6 可以免費使用嗎?

官方表示 Grok Build 可免費試用,並於發布首星期在 Grok Build 及 Cursor 提供 2 倍 included usage;但沒有公布 Grok 4.6 無限免費額度。SuperGrok 月費 US$30,官方列明包含 Grok 4.6。

Grok 4.6 可以直接生成圖片或影片嗎?

Grok 4.6 模型本身接受文字及圖片輸入,輸出文字。圖片及影片生成屬於 Grok Imagine 產品線,不應將兩者混為一談。

Grok 4.6 是否比 GPT-5.6 Sol 更好?

沒有單一答案。兩者在官方列出的 AA Intelligence Index 同為 61;Grok 4.6 在部分知識工作及 coding 評測較高,但 GPT-5.6 Sol 在 DeepSWE 及 Terminal-Bench 較高。應按真實任務、工具環境、成本和驗收結果選擇。

公司機密資料可以交給 Grok 4.6 嗎?

不應未經評估直接上載。API 資料預設保留 30 日作審核,雖然不會在未經許可下用作訓練;Zero Data Retention 亦會令部分功能不可用。企業應先做資料分類、脫敏、權限及合規評估。

資料來源

相關內容