MODEL GUIDE · ASTRA × SOL
GPT-6 Astra 正式登陸 ChatGPT Work:與 Sol 有何分別?能力、Token 收費與實際應用全解析
全面比較 GPT-5.6 Sol 的規格、能力評測及 Token 收費;從建築與遊戲實作,看清 Astra 在 ChatGPT Work 的應用價值與限制。

文章目錄
GPT-6 Astra 已經正式進入 ChatGPT Work 的模型陣容。對正在用 AI 寫程式、處理文件或建立工作流程的人來說,真正值得問的,不是「又有新模型?」而是:之前交給 GPT-5.6 Sol 已經做到的工作,為甚麼需要換成 Astra?如果 Token 更貴,它究竟靠甚麼令升級變得合理?OpenAI 的 Work 更新頁已介紹 Astra,但正式推出不代表每個帳戶同時開通;實際選項仍受方案、分批推出進度及管理員設定影響。ChatGPT Work 更新
先講結論:Astra 的重點是更可靠地完成複雜工作,不是把所有日常問題都變成需要旗艦模型處理的問題。按目前標準 API 價目,Astra 的主要 Token 單價是 Sol 現行推廣價的 2.5 倍,即貴 150%;但一項工作最後是否更貴,還要計算實際用量、重試、工具費及人工修改時間。以下會把「模型能力」、「Work 的執行環境」和「收費方式」分開說明,而不是混成一句「更強、更快、更抵」。API 價目
一、Astra 正式推出,與之前的 Astra 消息有甚麼不同?
我們早前介紹 Astra 時,焦點仍是推出前的安全評估及網絡安全能力。現在討論的是已公開的 GPT-6 Astra,官方 API 更新紀錄列出的推出日期為 2026 年 9 月 3 日;名稱、模型規格和收費已有正式文件可以核對。閱讀我們之前的 Astra 安全評估文章 時,應把它視為當時的發布前背景,不宜直接套用為今天的供應狀態。API 更新紀錄
首先要釐清,Astra 是模型,ChatGPT Work 是讓模型使用文件、工具及工作環境完成任務的產品介面。模型負責理解要求、推理和決定下一步;瀏覽器、檔案操作及外部系統連接則由環境提供。能否操作某個網站、讀取某份文件或更新某個系統,取決於實際工具、登入狀態及授權,不是選了 Astra 就自動取得所有權限。Work 模型選擇說明、瀏覽器能力說明

這亦不是「Sol 只會聊天,Astra 才開始做 Agent」。Sol 本身已支援工具調用及複雜工作;Astra 的比較價值,在於同樣面對多步驟任務時,能否更好地理解限制、維持上下文、選擇工具並交付可驗收的結果。Sol 模型規格
二、GPT-6 Astra 與 GPT-5.6 Sol:規格沒有全面翻倍
如果只看名稱由 GPT-5.6 變成 GPT-6,很容易以為所有容量也跟着大幅增加。但官方規格顯示,兩者的 Context Window 與最高輸出長度相同。Context Window 可理解為一次模型請求能容納的資訊範圍;容量相同,不代表在大量資訊中找出關鍵細節的能力相同。
| 比較項目 | GPT-5.6 Sol | GPT-6 Astra |
|---|---|---|
API 模型 ID |
gpt-5.6-sol |
gpt-6-astra |
Context Window |
1,050,000 Tokens |
1,050,000 Tokens |
最高輸出長度 |
128,000 Tokens |
128,000 Tokens |
知識截止日期 |
2026 年 2 月 16 日 |
2026 年 4 月 30 日 |
原生文字 |
輸入及輸出 |
輸入及輸出 |
原生圖片 |
輸入 |
輸入 |
原生音訊/影片 |
不支援 |
不支援 |
API 推理強度 |
none、low、medium、high、xhigh、max |
low、medium、high、xhigh、max |
資料來源:Sol 模型文件、Astra 模型文件。以上是 API 模型規格,不應直接當成所有 Work 介面的附件限制或可見選單。
這裏有兩個容易誤解的地方。第一,知識截止日期更新,不代表模型內置了今天所有新聞,涉及新產品、價格或政策仍需查證。第二,Astra 可以在合適環境調用圖片生成等工具,不等於它原生輸出圖片或影片;稍後介紹的 3D 場景和遊戲案例,同樣包含程式、製作軟件及人的反覆調整,而不是模型直接吐出一部完成影片。
三、能力差多少?有些大幅進步,有些只小幅領先
官方評測中,Astra 的提升並不平均。以下保留不同類型的測試,避免只抽取最誇張的數字。表內為各評測所報告的百分制分數,不能橫向視為同一種能力;差距以「百分點」表示,而不是籠統的「聰明了幾倍」。
| 官方評測 | Sol | Astra | 差距 |
|---|---|---|---|
AutomationBench |
18.1% |
41.4% |
+23.3 百分點 |
Terminal-Bench 4.0 |
37.3% |
57.9% |
+20.6 百分點 |
DeepSWE v1.1 |
72.7% |
74.1% |
+1.4 百分點 |
OSWorld 2.0,離線集、部分得分制 |
65.7% |
72.6% |
+6.9 百分點 |
Terminal-Bench Science 0.1 |
22.4% |
64.6% |
+42.2 百分點 |
MRCR v2,8-needle、512K–1M |
73.8% |
96.3% |
+22.5 百分點 |
以上摘自 OpenAI GPT-6 Astra 發布資料。官方採用的是各模型在不同推理強度下取得的最高分,並非全部以相同 Medium 或 High 設定對測;OSWorld 使用 v2026.08.08 離線測試集,採部分得分計分。評測環境也不能直接等同正式版 ChatGPT Work 的日常表現。
我們的解讀是:Astra 值得優先測試的,是需要串連多個步驟、工具及限制條件的工作。可是,DeepSWE 的差距只有 1.4 個百分點,也提醒我們不能把「複雜工作有明顯提升」偷換成「每項 Coding 工作都大幅領先」。同樣,長上下文測試分數上升,不代表你可以把一整個混亂資料夾交給它,然後取消文件整理及結果核對。
對企業而言,Benchmark 的用途是幫你決定先測甚麼,而不是替你完成採購決定。假如你的主要工作只是改寫短文、替資料加標籤或套用固定模板,即使新模型在另一類高難度測試表現突出,也未必能在你的工作中省下足夠時間。
四、放進 Work 之後,哪些工作最值得重新測試?
從「回答問題」走向「交付完整成果」
Work 的官方更新以複雜程式、研究,以及按照模板製作文書、試算表和簡報作為 Astra 的應用方向。重要的不是單一輸出格式,而是一項任務往往同時涉及讀資料、處理例外、製作檔案和核對成品。Work 更新說明
以香港中小企的月度營運報告為例,我們建議的測試不是問「幫我寫一份報告」,而是提供已去識別化的銷售紀錄、上月報告和指標定義,要求模型先核對退款及重複訂單,再產出有公式的試算表,最後把同一組已核實數字放進管理層摘要。這是可設計的試行流程,不是本文已完成的 Astra 實測;驗收重點應是各份成品數字一致,而不只是文字流暢。
視覺判斷與瀏覽器操作,需要一起驗收
Work 瀏覽器文件特別提到 Astra 的視覺判斷能力,以及比較頁面截圖、跨網站完成流程等方向。不過,能看到畫面與能正確完成業務操作,仍然是兩件事。Work 瀏覽器文件
例如製作活動網站時,可以要求它同時檢查桌面和手機版:標題有沒有被截斷、按鈕是否遮住內容、表格能否閱讀,以及表單錯誤提示是否合理。我們會把這類「建立後自行檢查,再交人驗收」列為測試重點;付款、發送訊息和公開發布則保留確認步驟。這樣才是在利用 Agent 的執行能力,而不是把執行權限無限放大。
對開發者而言,新能力也需要正確接法
官方更新同時提供非同步工具調用、工作進行期間的指令調整,以及保留快取的推理設定更新等能力。這些是開發者需要實際整合的 API 行為,不能推論為每個 Work 客戶端已自動開放同一套控制介面。API 更新紀錄
如果你把 Sol 接在自家系統,遷移也不是只換模型名稱。Astra 的工具調用需要使用 Responses API,亦不接受自訂 temperature、top_p 或 logprobs;應先用測試環境檢查現有參數及工具流程,再決定是否轉換。Astra 使用指南
五、Token 究竟貴了還是便宜了?先看單價,再看一整項工作的帳
標準 API:Astra 是 Sol 現行單價的 2.5 倍
以下全部是每 100 萬 Tokens 的美元價格,不是每次對話價格,也不是 ChatGPT 月費。Sol 採用目前的推廣價;官方更新紀錄表示優惠至少維持至 2026 年 11 月 21 日,並不代表已公布翌日一定調整至哪個價錢。API 價格更新
| 標準 API 計費項目 | Sol:輸入不超過 272K | Astra:輸入不超過 272K | Sol:輸入超過 272K | Astra:輸入超過 272K |
|---|---|---|---|---|
一般輸入 |
US$4 |
US$10 |
US$8 |
US$20 |
快取輸入 |
US$0.40 |
US$1 |
US$0.80 |
US$2 |
快取寫入 |
US$5 |
US$12.50 |
US$10 |
US$25 |
輸出 |
US$20 |
US$50 |
US$30 |
US$75 |
來源:官方 API 價目,2026 年 9 月 6 日核對。當輸入超過 272K Tokens,適用的是整項請求的長上下文費率,不是只有超出的部分加價。Astra 計費規格

一個可以直接理解的金額例子
假設一項工作使用 100,000 個一般輸入 Tokens,並產生 20,000 個計費輸出 Tokens,沒有快取、工具費或其他附加費。按上表計算,Sol 的模型費用是 US$0.40 加 US$0.40,合共 US$0.80;Astra 則是 US$1 加 US$1,合共 US$2。這是示範計算,不是承諾每份報告或每次 Coding 都只需這個價錢。
再假設 Astra 把輸出減少至 5,000 Tokens,但輸入維持不變,它的費用仍然是 US$1.25,高於 Sol 的 US$0.80。所以,「新模型用少了很多輸出 Tokens」不自動等於「整項工作更便宜」。若各類計費用量保持相同比例,在單價為 2.5 倍的前提下,Astra 的用量要降至 Sol 的 40% 以下,模型 Token 費才會更低;實際輸入、快取和輸出比例改變時,必須逐項重算。
為甚麼官方仍會說部分任務成本更低?
官方發布資料指出,Astra 在 Terminal-Bench 4.0 的較高表現,配合約低 9% 的估算成本;BenchCAD 則報告約低 43% 的估算成本。這些是特定評測的結果,不是所有工作一律節省同一百分比。Astra 發布資料
系統卡亦說明,相關成本估算使用離線模擬及 Token、工具行為等資料,真實部署的成本可以有明顯差異。因此,正確結論不是「Astra 其實更便宜」,而是「單價較高,但如果完成同一目標所需的過程明顯縮短,部分工作仍可能更划算」。Astra 系統卡
企業真正要看的,應是每份合格成果的總成本=模型費用+工具及執行費用+失敗重試成本+人工覆核及修改成本。如果模型費多了幾美元,卻能減少大量重做,可能值得;如果產物仍要由同事逐段重寫,價格表再漂亮也沒有意義。這是我們建議的評估方法,不是官方節省承諾。
六、在 ChatGPT Work 使用 Astra,並不是照 API 價目逐次扣美元
Work 的使用額度與 Codex 計量相關,必須和開發者 API 帳單分開理解。官方列出的模型 Token 點數,Astra 每百萬輸入/快取輸入/輸出分別為 250/25/1,250 credits;Sol 為 100/10/500 credits。按這三個類別比較,同樣是 2.5 倍,但 credits 並不等於美元,也不代表訂閱月費直接乘 2.5。Work 收費及用量說明
另一個容易混淆的細節是 Fast:官方 API 價目中的 Astra Fast 為標準 API 費率的 2 倍;Work 收費文件則列出 Astra Fast 的用量倍率為 2.5 倍。兩邊的名稱相近,計費環境並不相同,不應混用。API 價目、Work 用量倍率
實際使用時,不宜單憑「可發多少則訊息」估算能完成多少工作。一則要求修改短句的訊息,與一則要求查閱數十份文件、操作工具並反覆驗證的訊息,資源消耗可以完全不同。對工作量較大的團隊,我們建議同時記錄任務類型、推理設定、使用額度和人工修改時間,才看得到升級是否合理。
也要分清楚介面選項:Astra 的 API 推理強度最高列為 max;Work/Codex 的 Max、Ultra 等使用模式不能直接當成同名 API 參數。官方模型說明把 Ultra 與並行子代理工作聯繫起來,實際供應則視乎客戶端及方案。模型及推理選項
七、已經有人拿 Astra 做甚麼?從可走進去的房屋,到程序生成遊戲
以下不是我們自行想像的 Demo,而是 OpenAI 開發者網站在 2026 年 9 月 4 日刊載、由 Thomas Ricouard 具名分享的實作。不過,它們使用的是 Codex 配合 Astra 及製作工具,不能改寫成「所有步驟都在 ChatGPT Work 完成」,也不等於獨立第三方的大規模效果驗證。
建築視覺化:不是只有一張漂亮效果圖
在名為 Solace 的住宅項目中,作者以 Astra 配合 Blender 建立可編輯的 3D 場景,再反覆調整空間、家具、材質及燈光;項目亦延伸至 Unreal Engine 5 的第一身漫遊,包含開門、抽屜及燈光等互動。這裏值得留意的是,成果包含可繼續修改的場景及互動,而不只是一張不能編輯的圖片;過程也一直有人檢視並提出修正。Architectural visualization with Astra
對地產展示、室內設計提案或品牌體驗而言,我們的延伸判斷是:這類流程值得研究能否加快早期概念驗證。但示範中的房屋不應被視為已符合本地法規、結構要求或施工標準的建築文件,漂亮的漫遊也不能取代相關專業人士審核。
遊戲製作:除了畫面,還要讓系統互相配合
另一篇實作介紹了三個不同方向。Void Explorer 是程序生成的太空探索遊戲,包含 2,048 個星系及超過 10,000 顆行星,並處理飛行、降落和步行之間的切換;Sunwake 把海面波浪與船隻浮動、尾流等效果連結;Hollowflux 則利用地下河流及水中導電等機制設計 2D 動作 RPG。這些案例展示的不只是畫出一個畫面,而是讓多個遊戲系統共同運作。Building games with Astra
我們認為,對一般企業更接近的應用,可能不是立即成立遊戲工作室,而是互動產品展示、教育模擬、展覽體驗或活動小遊戲的原型。這是根據案例提出的應用方向,並非已核實的客戶部署。正式上線仍要另外處理裝置效能、相容性、素材授權、私隱及維護責任。
八、更強的 Agent,仍然需要清楚的工作邊界
官方使用指南指出,Astra 在指令遵循、釐清需求及工作連貫性方面有改善,但也提醒開發者注意可能出現的行為,例如小型程式工作仍進行過多測試、輸出比需要的更詳細,以及對 Skills 或 AGENTS.md 指令更敏感。換言之,能力升級不會令模糊要求自動變成良好的工作規格。Astra 使用指南
如果你只想修正一個按鈕,就應說明只改指定位置、保留原有設計,以及需要甚麼程度的測試;如果你需要深入研究,則應交代來源範圍、資料日期、交付格式和未知資訊如何標記。不要讓模型自行猜測你想要「快一點」還是「查得更深」,更不要把「完成工作」寫成默認允許它公開發布、付款或聯絡客戶。
長時間工作也不等於無限記憶。官方列出的實驗性 Context Management,推出時只適用於支援的 Codex 客戶端及指定 Plus/Pro 登入方式,預設關閉,並非所有 Work、Business、Enterprise 或 API 使用者都已有的通用功能。這類機制幫助延續跨上下文工作,不能理解成模型永久記住一切。實驗功能及適用範圍
安全方面,官方系統卡並沒有聲稱風險消失,亦提到監察可能影響合法任務的速度或完成情況。因此,較強的 Agent 更需要合理的權限及驗收:不必要的資料不要提供,不必要的外部操作不要授權,重要結論和不可逆動作仍由人確認。Astra 系統卡
九、香港企業應否立即由 Sol 全面轉去 Astra?
我們不建議把所有工作一刀切轉用 Astra,而是把模型選擇視為一個可驗證的營運決定。先挑出現有流程中最常失敗、最花人工修正或涉及最多工具切換的工作,再比較升級後是否真正改善。
| 你的主要任務 | 建議測試起點 | 驗收重點 |
|---|---|---|
跨多份文件、工具和限制條件的完整交付 |
優先測試 Astra |
完成率、資料一致性、例外處理及人工介入次數 |
已有穩定流程的專業寫作、分析或 Coding |
保留 Sol 作基準,與 Astra 對照 |
提升是否足以抵銷用量及等待成本 |
指令清楚、重複量高的分類、整理和固定格式輸出 |
測試 Terra/Luna 等選項 |
品質門檻、單位成本及速度 |

一個容易落地的試行方法,是抽取 10 至 20 項真實但已妥善處理敏感資料的歷史任務,讓 Sol 和 Astra 使用相同材料、工具權限及交付要求。事先定義甚麼叫「完成」,例如數字可追溯、公式可重算、引用可打開、手機版沒有文字溢出;再記錄資源消耗、完成時間和人工修改分鐘數。樣本不代表統計上的普遍結論,但足以先找出值得擴大測試的工作類型。
以下是可以改用於試行的任務要求。它刻意把驗收及權限寫清楚,而不是只要求模型「做到最好」。
請根據我提供的三份去識別化資料,製作本月營運分析。先核對欄位定義、重複紀錄及缺失值;遇到無法確認的資料,列出疑點,不要自行補數字。
交付一份可重算的試算表和一份管理層摘要。摘要中的每個主要數字,都要能追溯至試算表中的計算位置;觀察、推論和建議請分開表達。
完成後檢查兩份成品是否一致,列出已完成的核對及尚未解決的限制。只建立供我審閱的檔案,不要發送訊息、修改外部資料或公開發布;如需要新增權限,先詢問我。
這正是 Prompt、Context 與 Harness Engineering 的實際分別:不只改一句 Prompt,還要安排好資料、工具、限制及驗收方式。模型再強,也需要一個清楚的工作環境,才能把能力穩定轉化成成果。
常見問題
Astra 已經在 Work 推出,為甚麼我的帳戶仍然看不到?
正式推出與所有帳戶同步開放並不相同。請先確認使用的是 Work 的模型選擇介面,再查看方案、客戶端更新及企業管理員設定;可用項目仍以帳戶實際顯示為準。官方模型說明
API 單價是 Sol 的 2.5 倍,是否代表我的 ChatGPT 月費也變成 2.5 倍?
不是。API 美元帳單、Work 的模型用量點數,以及訂閱月費,是不同概念。前文的 2.5 倍指目前對應的 Token 單價比較;你在 Work 的實際可用額度仍須按方案及工作消耗判斷。
Astra 能原生生成影片或完整 3D 世界嗎?
官方 API 規格沒有原生影片輸出。本文的建築和遊戲實作,涉及 Astra 協調程式、Blender、遊戲引擎等工具,再經人反覆檢視;不能因此宣稱模型本身就是影片或 3D 生成引擎。
Sol 是否已經不值得使用?
不是。當 Sol 在你的任務中已達到品質要求,而且總成本較低,保留它完全合理。值得升級的依據,是 Astra 能否在同一驗收標準下減少失敗、重試或人工修改,而不只是版本名稱更新。
結語:真正要升級的,是交付成果的能力
GPT-6 Astra 登陸 ChatGPT Work,最值得留意的不是「AI 又多了一個名稱」,而是複雜工作可以如何重新分工。模型負責更多理解、執行及檢查,人則更清楚地定義目標、授權範圍和驗收標準。但更高的 Token 單價也迫使我們問一條更實際的問題:這個升級,究竟省下了多少失敗和人工重做?
我們的判斷是,Astra 適合先放進高複雜度、高修改成本的工作中測試,而不是直接取代每一個舊模型。當你能清楚說出它多完成了甚麼、少出錯在哪裏,以及一份合格成果最後用了多少資源,才算真正理解這次升級的價值。
AI LEARNING · 實戰學習
想將 Astra 用成工作成果,而不只是試新模型?
如果你想系統化學習如何把 AI 用在實際工作,可以了解 AD-Linkage 的人工智能應用績效實戰專業證書。課程涵蓋 Prompt、企業 AI 助手、RAG、AI Agent、MCP、n8n、Google AI 及 Vibe Coding 等應用方向,重點是建立能落地的工作流程,而不只是記住某個模型的功能名稱;具體工具及教學安排以最新課程資料為準。課程內容
對正在評估 Astra 的企業或工作者而言,更長遠的能力,是學懂如何整理 Context、連接合適工具、設定工作邊界,以及驗證 AI 的交付成果。這些方法不會因下一個模型推出便失去價值。