Gemini 3.8 Flash 於 20 日後再升級,圖示 3.6 至 3.8 發布時間線及 Token 成本概念

Gemini 3.8 Flash 是甚麼?相隔 20 日再升級,推廣單價暫時相同但每項任務未必同價

直接答案

Gemini 3.8 Flash 是 Google 於 2026 年 9 月 2 日正式推出的 Gemini Flash 模型,Model ID 為 gemini-3.8-flash。核心模型不是 Preview,而是已達 Generally Available(GA)的 Stable 模型,主要提升長時間軟件開發、AI Agent、工具調用,以及需要多步推理的企業工作;不過,Computer Use 功能仍屬 Preview。

Google 將它定位為維持 3.7 Flash 的速度與 API 推廣單價,但這句說法要拆開看:3.8 在複雜任務中可能執行更多推理步驟、反覆調用工具及驗證結果,因此即使每百萬 token 價格相同,每項任務的總成本仍可能較高。簡單、重複及延遲敏感的工作,未必需要立即由 3.7 轉到 3.8。

懶人包(TL;DR)
  • Google 在 3.7 Flash 推出 20 日後便發布 3.8 Flash;由 3.6 到 3.8,43 日內共有三次 Flash 更新。
  • 3.8 的主要升級不是更長 context,而是更擅長長時間 Coding、Agent 工具調用、電腦操作及複雜多步推理。
  • 3.7 與 3.8 的 Standard API 推廣價相同:每 100 萬 input tokens US$0.75、output tokens(包括 thinking tokens)US$3.75;推廣價只維持至 2026 年 12 月 31 日。
  • 「每 token 同價」不等於「每項任務同價」。3.8 可能為提高完成率而使用更多推理及工具調用,企業要比較完整 workflow 成本。
  • 一般版 3.8 Flash 已正式開放;3.8 Flash Cyber 則只經 Fairwind Program 向獲批的可信防守機構提供,兩者不能混為一談。

AI 模型更新得愈來愈快,企業很容易產生一種壓力:新版本一出,是否應該立即轉?今次答案尤其不能只看版本號,因為 Gemini 3.8 Flash 的確在多項官方評測中高過 3.7,亦更適合 Coding 和長時間 Agent 工作;但它的設計正正是「遇到難題時做多幾步」,所以可能消耗更多 tokens。

真正應該問的,不是「3.8 是否最強」,而是「它能否以更少重試、更少人工修改,完成你公司的真實工作」。這個問題會同時牽涉任務完成率、延遲、token 用量、工具費用及人工覆核,而不是一個模型排行榜便能回答。

1. 六星期三次 Flash 更新,快到代表甚麼?

Google 官方把今次形容為六星期內第三次 Flash release。按 Gemini API 更新紀錄計算,Gemini 3.6 Flash 於 2026 年 7 月 21 日推出,3.7 Flash 於 8 月 13 日推出,而 3.8 Flash 則在 9 月 2 日登場。

型號 GA 日期 與上一版本相隔
Gemini 3.6 Flash 2026 年 7 月 21 日
Gemini 3.7 Flash 2026 年 8 月 13 日 23 日
Gemini 3.8 Flash 2026 年 9 月 2 日 20 日

換句話說,由 3.6 到 3.8 只用了 43 日。這個速度反映 Google 正快速迭代 Flash 路線,但不代表企業應該每三星期全面遷移一次;模型更新愈密,版本管理反而愈重要。

Prompt、function calling、輸出格式、thinking 設定及成本都可能隨版本改變。若一見新型號便直接替換 production model,測試不足所帶來的錯誤,隨時比模型能力提升更昂貴。

想先了解 Gemini 3 整個系列的基本定位,可參考 AD-Linkage 的Google Gemini 3 功能、方案與比較。今次 3.8 的重點不是再解釋 Gemini 是甚麼,而是判斷 3.7 與 3.8 應該如何分工。

Gemini 3.6、3.7 及 3.8 Flash 在 43 日內發布的時間線,版本間隔分別為 23 日及 20 日
Gemini 3.6 Flash、3.7 Flash 與 3.8 Flash 的發布日期及間距。

2. Gemini 3.8 Flash 真正升級了甚麼?

Google 對 3.8 Flash 的三個主要定位是長時間軟件工程、自主 Agent,以及複雜企業工作流程。規格本身沒有大幅改變,真正的分別在於模型處理困難任務的方式。

規格沒有大改,工作方式才是重點

項目 Gemini 3.8 Flash
Model ID gemini-3.8-flash
狀態 核心模型 GA/Stable;Computer Use 功能仍屬 Preview
Input 文字、圖片、影片、音訊、PDF
Output 文字
Context limit 1,048,576 tokens
最高 output 65,536 tokens
Thinking level lowmediumhigh;預設 medium

以上 context 及 output 上限與 3.7 Flash 相同,所以 3.8 並不是靠「塞入更多資料」形成升級。主要分別是面對困難、長時間任務時,它會把問題拆得更細,反覆使用工具,再檢查自己的結果。

這類能力對以下工作較有價值:

  • 跨多個檔案修改程式、執行測試、找出失敗原因再修正;
  • 讓 Agent 連續使用搜尋、資料庫、試算表或內部工具完成任務;
  • 需要分析、整理、驗證及撰寫報告的多步驟專業工作;
  • 需要電腦操作或瀏覽器互動,但同時設有權限和人工覆核的流程。

如果想了解 AI 寫程式由 Prompt 到測試的實際分別,可延伸閱讀《Vibe Coding 是甚麼?》

官方 benchmark 有提升,但不是每項都大幅拋離

Benchmark 3.8 Flash 3.7 Flash 差距
DeepSWE v1.1(長時間軟件工程) 73.7% 65.3% +8.4 個百分點
Terminal-bench 2.1(終端機 Agent) 89.4% 85.8% +3.6 個百分點
OSWorld 2.0(電腦操作) 59.0% 50.6% +8.4 個百分點
HLE-Verified(跨領域多步推理) 54.9% 53.6% +1.3 個百分點

這組數字說明兩件事:第一,3.8 的改善不限於 Coding,電腦操作及跨領域推理亦有提升;第二,不同測試的增幅差距很大,不能把「某一項高 8.4 個百分點」寫成所有工作都快或準 8.4%。

上述屬 Google 發布或整理的評測,部分使用官方測試設定,並非 AD-Linkage 的獨立實測。Benchmark 可以用來篩選候選模型,但不能代替公司自己的文件、Prompt、工具和驗收標準。

Google 公布的 Gemini 3.8 Flash 與 3.7 Flash 四項評估比較,包括 DeepSWE、Terminal-bench、OSWorld 及 HLE-Verified
Google 公布的模型評估顯示,Gemini 3.8 Flash 在四項測試均高於 3.7 Flash;數據並非第三方獨立實測。

3. API 價格真的沒有變?要分清「單價」與「總價」

Google 表示 3.8 Flash 維持 3.7 的 Flash 級速度與相同 API 推廣價。就 Standard API 而言,兩個模型目前的單價的確相同,但現有定價設有清楚的推廣期限。

Standard API(每 100 萬 tokens) 至 2026 年 12 月 31 日 2027 年 1 月 1 日起
Input US$0.75 US$1.50
Output(包括 thinking tokens) US$3.75 US$7.50

這裡有兩個容易被新聞標題忽略的細節。第一,US$0.75/US$3.75 是推廣價,不是永久定價;按目前公布資料,2027 年 1 月 1 日起,input 與 output 單價都會加倍。第二,3.8 的 output 收費包括 thinking tokens,而 Google 已明確提醒 3.8 在複雜任務可能使用更多 tokens。

成本計算提示

每項任務總成本 ≈ input tokens × input 單價 +(output tokens + thinking tokens)× output 單價 + 工具/搜尋費用 + 重試成本 + 人工覆核時間成本

舉一個純粹用來解釋計法的例子:同一工作輸入 10 萬 tokens,如果模型使用 2 萬 output/thinking tokens,按推廣價計約為 US$0.15;若另一個模型為同一工作使用 3 萬 output/thinking tokens,便約為 US$0.1875。兩者每百萬 token 單價相同,但後者的模型費用高 25%,而實際 Agent workflow 還可能有多輪工具調用、重新輸入 context 及失敗重試。

所以,「簡單工作繼續用 3.7 可能更慳」的準確意思,不是 3.7 每 token 較平,而是它可能用較少推理步驟完成同一件事。另一個選擇,是在 3.8 使用 low thinking level,減少延遲及 token 消耗。

4. 哪些工作值得試 3.8?哪些不用急住轉?

工作類型 建議起點 原因
短文草稿、分類、欄位抽取、簡單摘要 保留 3.7,或測試 3.8 low 任務短而明確,額外推理未必帶來可量度回報
即時聊天、大量低延遲請求 先比較 latency 及每項任務 token Google 形容速度維持 Flash 級,但未提供完整的 3.7 對 3.8 實際延遲對照
多檔案 Coding、重構、測試與除錯 優先測試 3.8 medium 這正是 3.8 的核心升級場景
多步 Agent、反覆工具調用 測試 3.8 mediumhigh 較強的規劃、驗證及工具協調可能減少重試和人工介入
財務、法律或其他高風險分析 可測試 3.8,但保留專業覆核 官方評測有改善,不代表可以取代責任人或專業判斷
已穩定運作、成本可控的 3.7 production 流程 先做平行 A/B test 3.7 仍獲完整支援,沒有立即停用壓力
關鍵決策

先按任務選擇模型,再比較完整任務的完成率、延遲、token、重試和人工時間。若 3.7 已能穩定完成短而明確的工作,保留 3.7 並不是落後;若工作需要長時間規劃、工具協調及自我驗證,才值得優先測試 3.8。

這個判斷方法亦適用於其他 AI 工具,重點是先按任務選擇,再比較完成率,而不是追逐單一排行榜。可參考 AD-Linkage 的2026 AI 工具任務地圖

Gemini 3.8 Flash 選型指引,分別列出適合測試 3.8 及可保留 3.7 或 3.8 Low 的工作
按任務複雜度、成功率、Token 用量、延遲及人手介入選擇模型,而不是只追版本號。

5. Gemini 3.8 Flash Cyber 是另一個版本,並非人人可用

Google 今次同時推出 Gemini 3.8 Flash Cyber,專門處理漏洞發現及自動修補。Google 公布的 CyberGym Pass@1 成績為 86.2%,在其內部、涵蓋 20 種程式語言的漏洞發現測試中,成功率則超過 70%;不過,這些仍是供應商公布的評測,企業不應視作對任何程式庫或環境的保證。

更重要的是,Cyber 並不是一般 Gemini API 用戶選擇一個 model ID 便可以使用。它只經 Google DeepMind 的 Fairwind Program,向政府機構、關鍵基建營運者、軟件維護者,以及其他經 Fairwind Program 審批的可信防守夥伴提供。截至本文核對日期,Google 沒有公布一般公眾可用的 Cyber model ID 或獨立 token 定價。

因此,普通 3.8 Flash 與 3.8 Flash Cyber 要分開理解:前者是已經可經 Gemini API、Google AI Studio 等入口使用的通用模型;後者是受限制的網絡安全部署。兩者基於相同核心智能,不代表權限、功能、保障或使用入口完全一樣;個別產品入口仍視乎帳戶、方案及地區推出安排。

6. 香港企業應該如何測試?先比較「完成一件事」的成本

最實際的方法,是揀一條真實但風險可控的 workflow,讓 3.7 與 3.8 在相同 Prompt、工具及資料條件下完成同一批工作,再以整項任務的結果決定是否遷移。

第一步:定義一項可驗收任務

例如整理銷售報告、把表格轉成客戶摘要、修改網站一個功能,或者從指定資料庫產生有來源的研究初稿。不要一開始便用「提升公司效率」這類無法驗收的目標,而要明確列出合格輸出、禁止行為及人工確認點。

第二步:建立固定測試集

可先抽取 20 至 50 個過往真實案例,移除不必要的個人或機密資料,再為每個案例定義合格答案、失敗條件及需要人工確認的位置,確保兩個模型是在相同標準下比較。

第三步:同 Prompt、同工具、同條件比較

至少記錄任務完成率、重要錯誤、工具調用成功率、重試次數、首個可用答案所需時間、input/output tokens,以及人工修改時間。只量度首次回應速度,會忽略修正錯誤及重新執行所消耗的成本。

第四步:把模型費與人工時間放在同一張表

如果 3.8 每次多用 20% tokens,但把人工修正時間減少一半,整體上可能更便宜。相反,如果一項分類工作本身已由 3.7 穩定完成,3.8 多做的推理可能只是成本,未必構成真正的業務回報。

第五步:小流量上線,再逐步擴大

先限制資料範圍、工具權限及可執行動作,保留日誌、人工確認及停止機制。當錯誤模式和總成本穩定後,才逐步增加流量;即使模型支援 100 萬 token context,也不代表應該把所有公司文件一次過放進去。

如果你的團隊正在由單次對話走向可排程、可重用的 Agent 流程,也可先了解AI Agent 與自動化工作流,理解模型、工具、權限與人工審批為何要一併設計。

開發者由 3.7 遷移到 3.8,要留意哪些設定?

Gemini 3.8 Flash 的 Model ID 是 gemini-3.8-flash。Google 的遷移文件另列出以下需要檢查的設定:

  • 移除 temperaturetop_ptop_kcandidate_count
  • thinking_level 取代 thinking_budget
  • 只使用 lowmediumhigh,因為 3.8 不支援 minimal
  • 重新測試 function calling、turn validation 及 multimodal payload;
  • 不要只確認 API 能回應,還要重跑原有測試集及成本基準。

3.7 目前仍獲完整支援,所以最穩妥的做法是保留 rollback 路線,先將一部分流量切到 3.8,而不是一次過替換全部 production workload。

結論|新版本值得測試,但不值得盲目追

Gemini 3.8 Flash 最值得留意的,不只是 20 日又升一代,而是 Flash 模型正由「快而平的日常模型」,進一步承擔長時間 Coding、Agent 和複雜企業工作。不過,Google 自己亦清楚說明,3.8 為了得到更好結果,可能做更多推理、調用更多工具及使用更多 tokens。

這正好說明企業選 AI 時最容易犯的錯:只看每百萬 token 價格,卻沒有量度完成整項工作的成本。對大部分團隊而言,合理做法不是立即全面轉用,而是保留 3.7 處理簡單、穩定、高流量工作,用 3.8 測試真正需要長推理、Coding 或 Agent 協調的任務,最後按完成率、人工時間、延遲和總成本決定路由。

AI 實戰學習路線

想將 Gemini 同 AI Agent 真正用落工作?

AD-Linkage「人工智能應用績效實戰專業證書」會透過 Prompt、企業 AI 助手、RAG、AI Agent、MCP、n8n、Google AI 及 Vibe Coding 等實戰內容,協助你由追模型更新,進一步學識按工作需要選擇模型、設計 AI 工作流程同驗證實際成效。

查看「人工智能應用績效實戰專業證書」

常見問題 FAQ

Gemini 3.8 Flash 幾時推出?

Gemini 3.8 Flash 於 2026 年 9 月 2 日推出,距離 3.7 Flash 的 2026 年 8 月 13 日相隔 20 日。它已是 GA/Stable 模型,而非 Preview。

Gemini 3.8 Flash 比 3.7 Flash 貴嗎?

兩者目前的 Standard API 每 token 單價相同:推廣期內每 100 萬 input tokens US$0.75、output tokens US$3.75。不過 3.8 在複雜任務可能使用更多 thinking tokens 和工具調用,所以每項任務的總成本未必相同。

Gemini 3.8 Flash 的優惠價維持到幾時?

Google 現時列出的推廣價維持至 2026 年 12 月 31 日。由 2027 年 1 月 1 日起,Standard API input 價格為每 100 萬 tokens US$1.50,output 為 US$7.50;價格及條款可能更新,正式部署前應再核對官方價格頁。

Gemini 3.8 Flash 是否一定比 3.7 快?

Google 表示 3.8 維持 3.7 的 Flash 級速度,但沒有提供涵蓋所有工作、可直接證明兩者延遲完全相同的完整對照。3.8 在 high thinking level 可能做更多步驟,因此真實回應時間仍要按你的 workload 測試。

是否應該立即將所有工作轉到 Gemini 3.8 Flash?

不需要。多檔案 Coding、長時間 Agent 及複雜多步分析值得優先測試 3.8;短文草稿、簡單分類、抽取和已穩定運行的高流量工作,可以繼續使用 3.7,或比較 3.8 的 low thinking level。

一般公司可以使用 Gemini 3.8 Flash Cyber 嗎?

一般版 3.8 Flash 已經可經 Gemini API、Google AI Studio 等入口使用,但 Cyber 版本只經 Fairwind Program 向獲批的可信防守機構提供。Google 暫未公布一般公眾可直接使用的 Cyber model ID 或獨立 API 定價。

官方資料來源

資料核對日期:2026 年 9 月 4 日。模型功能、價格、推出地區及服務條款可能更新,採用前請以官方資料為準。

相關內容