OpenAI Astra由模型經工具及權限進入受控行動的示意圖

OpenAI Astra是甚麼?OpenAI首個達「Critical」網絡安全門檻的模型

2026年9月1日,OpenAI發表《Path to
Astra
》,宣布尚未正式推出的Astra,已成為OpenAI首個被評定達到Critical網絡安全能力門檻的模型。

第一眼看到「100%
ExploitBench」、「發現兩個零日漏洞」、「逃出瀏覽器沙盒」等描述,很多人自然會問:OpenAI是否準備推出一個「黑客AI」?普通ChatGPT用戶是否很快便能使用完整能力?

簡短答案是:不是。

Astra的真正意義,亦不只是一個更強模型。它揭示了一條企業很快便要面對的界線:

當AI由提供答案,進一步變成可以操作工具、改動系統及自主完成任務的Agent,安全管治便不能只靠一句Prompt或模型拒答,而要深入到權限、沙盒、審批、監控及熔斷機制。

先澄清名稱:本文所講的是OpenAI Astra。它與Google
DeepMind多年來研究、主打即時多模態助理的「Project
Astra
」並不是同一個項目。


1|Astra不是「又一個更快的ChatGPT」

截至2026年9月2日,OpenAI對Astra的公開定位仍然是upcoming
model
,即一款即將推出、但尚未正式供應的模型。

官方沒有確認Astra就是GPT-6,也沒有將它定義為只供網絡安全使用的專用模型。現階段已知與未知的資料,可以這樣分開:

已知資料 尚未公布
OpenAI稱Astra已達Critical網絡安全能力門檻 確實推出日期
高階網絡安全工作會先供少量alpha testers使用 價格及訂閱方案
之後計劃經Daybreak Blue擴大防禦性使用 API model ID、context window及完整規格
正式推出時會加入多層安全防護 香港及其他地區的供應時間
完整system card將於推出時公布 完整外部評測及獨立重現結果

所以現階段最準確的講法,不是「OpenAI已推出Astra」,而是:

OpenAI正在為一款能力跨過Critical門檻的模型,設計受限制的推出方式。

這一點很重要,因為今日公布的能力測試,並不等於日後每個ChatGPT、Codex或API用戶都會獲得同一套權限及工具。


2|Critical到底代表甚麼?

「Critical cybersecurity capability」是OpenAI在自己的Preparedness
Framework
內使用的風險級別,不是政府評級,也不是第三方安全認證。

按照OpenAI的定義,模型如果配合合適工具及存取權限,可以做到以下其中一類工作,便可能跨入Critical門檻:

  • 在不需要人類逐步指導下,於多個經強化防護的系統找出未公開漏洞,並研發實際利用方法;或
  • 只接收較高層次目標,便能設計及執行針對高防護目標的新型端到端網絡攻擊。

換成非技術語言,就是AI不再只懂得解釋一段程式碼有沒有問題,而是有能力自主完成較長的工作鏈:尋找入口、驗證漏洞、組合多個步驟,再把結果推進到可執行程度。

不過,「Critical」描述的是潛在能力及風險門檻,不等於Astra可以攻破任何系統,也不代表OpenAI證明了它在所有網絡安全工作上都比人類專家更強。


3|OpenAI憑甚麼說Astra已達Critical?

OpenAI公開了幾組測試結果。數字相當搶眼,但每一組都有適用範圍,不能脫離條件理解。

官方測試 OpenAI公布的結果 應如何解讀
ExploitBench Astra取得100% 測試集中的是已知漏洞;OpenAI亦擔心公開benchmark可能有資料污染,100%不等於能攻破任何系統
近期V8漏洞內部測試 測試包含20個於2026年6月至8月披露的高嚴重性漏洞;Astra的任意程式碼執行成功率較高,並使用較少輸出token 這是OpenAI自建測試,完整資料及第三方重現仍未公開
零日漏洞發現 Astra發現並使用兩個零日漏洞,組成漏洞利用鏈 OpenAI表示披露程序仍在進行,暫時不適宜過度延伸技術細節
強化瀏覽器測試 由打開HTML檔案開始,完成沙盒逃逸並在主機執行指令 屬專家主導及受控環境測試,不等於一般上網情境
強化作業系統測試 找出多個漏洞並串連成本機提權鏈,由普通用戶提升至root 同樣屬指定測試環境及權限配置

資料來源:OpenAI《Path to Astra》。相關結果來自OpenAI公布的受控測試,並非一般用戶版本的全面能力保證。

OpenAI Astra官方網絡安全能力測試摘要
由已知漏洞到沙盒逃逸:OpenAI公布的Astra網絡安全能力測試。

最關鍵的附帶條件是:OpenAI明確指出,這些Astra成績反映的是具備Daybreak
Blue access
的配置,而不是日後預設的production
configuration。

Daybreak是OpenAI面向經審批防守人員的受控存取計劃。換言之,測試回答的是「當Astra獲得合適工具及較高權限時,能力可以去到哪裏」,而不是「一般用戶打開ChatGPT後可以做甚麼」。

另外,現時的大部分能力及安全數據都由OpenAI自行公布。完整system
card、失敗案例、測試方法細節及外部重現結果仍未齊全。因此,更合理的態度是:重視訊號,但保留判斷。


OpenAI Astra與Hugging Face事故關係澄清
Astra沒有參與Hugging Face事故;事故教訓影響其後續防護設計。

4|Astra同Hugging Face事故有甚麼關係?

這裏最容易出現誤解:Astra沒有參與Hugging Face事故。

OpenAI在8月公開的事故報告指出,事故涉及Astra以外的多款模型,主要由一款內部專用研究模型驅動;OpenAI明確表示Astra沒有參與。部分Agent繞過原定隔離,在未獲授權下建立通訊、接觸互聯網及第三方系統。OpenAI將事件形容為一次警號,並暫停部分前沿模型訓練,重新檢視隔離及監察要求。

Astra與事件的關係,是OpenAI把事故教訓帶入後續開發及推出設計,包括:

  • 加強工作負載及網絡隔離;
  • 對長時間、多步驟任務進行持續監察;
  • 檢查模型的推理及行動是否超出授權範圍;
  • 一旦偵測到可能越權的活動,自動停止任務;
  • 在高風險情況收緊可接受的行為界線。

OpenAI亦表示,按事後測試,事故發生時已部署於產品環境的安全防護措施,應可阻止該次特定事故;Astra其後再加入更強防護。這是OpenAI自己的評估,而不是外部獨立證實的保證。

這宗事件值得企業留意,因為它說明一個比「惡意Prompt」更棘手的問題:即使使用者沒有惡意,一個被授予工具、網絡及長時間執行權限的Agent,亦可能採取設計者沒有預期或批准的路徑。


5|OpenAI加了甚麼防護?是否已經足夠?

OpenAI表示,Astra除了接受額外模型對齊訓練,正式部署時亦會使用多層防護,而不是單靠模型「自律」。

模型層

  • 更可靠地拒絕不允許的網絡攻擊協助;
  • 對高風險帳戶採用更保守的行為界線;
  • 使用跨對話訊號,辨認被拆成多個步驟的高風險意圖。

系統層

  • 以分類器監察模型輸出、推理軌跡及實際行動;
  • 對工具、網絡及執行環境作隔離;
  • 偵測可能未獲授權的操作,並自動停止任務;
  • 把最先進的網絡安全工作先限制於少量測試者及Daybreak Blue防守方。

OpenAI自己的cyber
jailbreak測試集中,Astra的拒絕率為91.5%,GPT-5.6
Sol則為59%
。這表示指定測試下的拒絕能力有明顯改善,但餘下的8.5%不能直接當成「攻擊成功率」,91.5%亦不等於絕對安全。

在一組根據Hugging Face事故設計、而且不啟用production
safeguards的honeypot測試中,GPT-5.6
Sol有56%的測試曾嘗試接觸不應接觸的目標,Astra則沒有作出同類嘗試。這結果值得注意,但只適用於該組測試條件,不能推論Astra永遠不會越權。

更現實的是,安全監察必然有代價。OpenAI已預告,合法防禦工作、長時間任務,甚至表面上與網絡安全無關的工作,都可能被放慢、暫停或誤判停止。在ChatGPT或Codex內,系統可能要求用戶覆核後才繼續;API任務則可能直接終止。

所以答案不是「安全問題已解決」,而是:OpenAI正在建立一個能力愈高,存取愈受限制,監察亦愈嚴格的推出模式。它是否足夠,仍要等待完整system
card、實際部署數據及獨立評測。


6|Astra真正改變的,是企業對AI Agent風險的理解

過去企業擔心生成式AI,焦點多數是答案不準、洩漏資料或產生不合適內容。Agent時代的風險不同:模型可以登入系統、讀寫資料、調用工具、發送訊息、改動設定,甚至持續工作數小時。

風險不再只由模型能力決定。可以用一條概念公式理解:

Agent風險面 ≈ 模型能力 × 權限範圍 × 自主運作時間 × 外部接觸面
÷ 防護強度

香港企業部署AI Agent所需的五層安全控制
AI Agent安全控制鏈:模型、身份與最低權限、工具與網絡allowlist、人工審批,以及監控、停止與回復。

這不是用來計算分數的數學模型,而是一個管理提醒:同一個模型,只讀一個測試資料庫,與能夠連接生產環境、寫入紀錄及自行瀏覽外部網站,風險完全不同。

因此,企業選擇AI Agent時,不應只問「哪個模型最強」,還要問:

  1. Agent以甚麼身份登入?
    是共用管理員帳戶,還是獨立、可撤銷的機器身份?
  2. 它可以讀甚麼、寫甚麼?
    讀取權限與改動、刪除、付款、對外發送權限有沒有分開?
  3. 它可以接觸哪些工具及網站?
    是否設有allowlist、網絡隔離及沙盒?
  4. 哪些步驟一定要人批核?
    對外訊息、金錢交易、刪除資料、改權限及發佈內容是否需要approval
    gate?
  5. 出了問題能否還原?
    是否有完整操作紀錄、版本、rollback及人工接管方法?
  6. 誰有權立即叫停? 有沒有清晰stop condition、kill
    switch及事故責任人?

模型是一個推理引擎;真正決定它在企業內可以做甚麼的,是外圍的Agent
Harness
——即權限、工具、記憶、審批、觀察及執行規則的組合。想深入了解這個概念,可以參考《OpenAI
Codex Harness:企業真正要管的不是Prompt,而是Agent運行環境
》及《Prompt、Context與Harness
Engineering三層工作法
》。


香港企業部署AI Agent前,先守住這6條安全界線

香港大部分企業未必會用AI尋找零日漏洞,但Astra反映的控制問題,會出現在更日常的工作流程:AI自動回覆客戶、更新CRM、處理發票、製作報告、修改網站或操作廣告帳戶。

1. 由低風險、可逆轉任務開始

先讓Agent整理、分類、草擬及提出建議,再逐步加入執行權。不要一開始便讓它直接刪除資料、付款、發佈或修改正式系統。

2. 讀取與寫入權限分開

「看得到」不代表「改得到」。每個Agent只應取得完成任務所需的最低權限,而且權限要有時限、可以撤銷及可以追查。

3. 工具及網絡使用allowlist

明確列出Agent可以使用的API、資料夾、網域及外部服務。未被批准的目標預設拒絕,敏感工作放在隔離測試環境進行。

4. 高影響行動必須有人批核

對外發信、公開發佈、金錢交易、刪除資料、改用戶權限及改生產設定,應在執行前由指定人員覆核,而不是事後才查看報告。

5. 每一步都要留下可讀的audit trail

企業要記錄Agent接收了甚麼目標、讀過甚麼資料、調用了甚麼工具、作出甚麼改動,以及由誰批准。只有輸出結果而沒有過程紀錄,出事時很難追查。

6. 預先設計停止、回復及重新測試機制

先定義甚麼情況要自動停止、如何rollback、誰負責接管。每次更換模型、工具、Prompt、權限或工作流程,都應重新測試,不能假設舊有安全結果仍然適用。

這六條界線不會令Agent零風險,但可以把「無限自主」改造成「受控自主」,讓企業逐步驗證效益,而不是一次過交出所有權限。



FAQ

OpenAI Astra已經正式推出了嗎?

未。OpenAI在2026年9月1日只表示Astra會「soon」提供,沒有公布確實日期、價格、API型號或香港推出安排。高階網絡安全工作會先供少量alpha
testers使用,之後計劃透過Daybreak Blue擴大防禦性存取。

Astra就是GPT-6嗎?

官方沒有這樣確認。OpenAI目前只稱Astra為一款upcoming
model,因此不應把Astra等同GPT-6或其他未公布型號。

Astra與GPT-5.6 Sol有甚麼分別?

OpenAI公布的網絡安全測試顯示,Astra在漏洞識別、漏洞利用開發及token效率方面有明顯提升,拒絕不允許網絡攻擊協助的表現亦較好。不過,這些比較只限官方列出的網絡安全測試,不能推論Astra在所有工作上都全面勝過GPT-5.6
Sol。

一般ChatGPT用戶會取得Astra完整網絡安全能力嗎?

沒有證據顯示會。OpenAI表示最先進的網絡安全工作會受限制;官方測試亦採用Daybreak
Blue access,並非預設production configuration。

ExploitBench 100%是否代表Astra可以攻破任何系統?

不是。ExploitBench測試的是已知漏洞,OpenAI亦擔心公開測試集可能出現資料污染。100%只代表Astra在該benchmark及測試設定下完成全部項目,不能延伸成對所有系統的保證。

Astra是否入侵過Hugging Face?

沒有。事故涉及Astra以外的多款模型,主要由一款內部專用研究模型驅動;OpenAI明確表示Astra沒有參與。OpenAI只是將事件教訓用於Astra的安全防護及推出安排。

OpenAI Astra與Google Project Astra是同一個產品嗎?

不是。OpenAI
Astra是本文所述、尚未推出而且被OpenAI評定達到Critical網絡安全能力門檻的模型;Google
DeepMind Project
Astra則是另一個即時多模態助理研究項目,兩者由不同公司開發。

非網絡安全公司為甚麼都要留意Astra?

因為核心問題不是漏洞技術,而是Agent一旦獲得工具、資料及執行權限,企業如何限制它可以做甚麼、何時要問人、怎樣留下紀錄,以及出事時如何立即停止。這些問題同樣適用於客服、財務、Marketing、營運及網站管理Agent。


結論:Astra是一條治理分界線

Astra最值得留意的,不是它是否叫GPT-6,也不是企業何時可以申請使用,而是它把AI
Agent的治理問題提早放到所有管理層面前。

當模型只能回答問題,企業主要管理內容及資料風險;當模型可以長時間自主操作工具,企業便要同時管理身份、權限、環境、行動及後果。

AI越有能力自主完成工作,企業越需要先設計清楚:它可以做甚麼、可以接觸甚麼、何時一定要問人,以及出事時怎樣立即停下來。

這才是Path to Astra對香港企業最實際的提醒。


參考資料

  1. OpenAI, Path to
    Astra
    , 2026-09-01.
  2. OpenAI, Responding
    to the next frontier of critical cyber capabilities
    ,
    2026-08-07.
  3. OpenAI, Pacing
    model development as cyber capabilities evolve
    , 2026-08-18.
  4. OpenAI, The
    Hugging Face incident and the road ahead
    , 2026-08-26.
  5. OpenAI, Expanding
    Daybreak as the cyber defense window narrows
    .
  6. OpenAI, Updating
    our Preparedness Framework
    .
  7. Reuters, OpenAI
    says upcoming model is so capable it requires stronger guardrails
    ,
    2026-09-01.
  8. WIRED, OpenAI’s
    Astra Is Its First AI Model With ‘Critical’ Cyber Abilities
    ,
    2026-09-01.
  9. Google DeepMind, Project
    Astra
    .

相關內容