OpenAI 在今日正式發表新一代前沿模型 GPT-6 Astra,並在官網稱其為「世界上最智能、最對齊的模型」。總裁 Greg Brockman 更直言「我們已經到了 AGI」,這句話引發了社群熱議。如果你還不確定 Astra 到底帶來哪些突破、與前代 GPT-5.6 Sol 差在哪裡、以及安全疑慮是怎麼回事,這篇文章會用比較白話的方式為你整理重點。

GPT-6 Astra 是什麼?

GPT-6 Astra 是 OpenAI 最新推出的旗艦級模型,名稱中的「Astra」來自拉丁文,有「星辰」之意。它整合了 OpenAI 在預訓練、強化學習與對齊研究上的成果,特別強化了在電腦操作、瀏覽器使用、軟體工程、網路安全、科學研究與專業工作等領域的表現。簡單來說,它不只想「更會回答問題」,更想「更會動手做事」。

用比較容易理解的方式說:過去我們用 AI 聊天、寫文章,但 Astra 的目標是直接幫你操作電腦、寫程式、分析數據,甚至像一個數位員工那樣完成多步驟的任務。

GPT-6 Astra 是什麼


GPT-6 Astra 的主要亮點

1. 電腦操作能力大幅躍進

OpenAI 稱 Astra 是「世界上最好的 computer use 模型」。它的能力包括:

  • 自動填寫網頁表單、更新 CRM 客戶記錄、整理行事曆
  • 進行網路研究,並將結果整理成郵件或文件
  • 分析科學數據、產出圖表、建立網站、執行前端測試
  • 自主安裝與測試軟體,並依據螢幕上的錯誤訊息持續除錯

這些任務在測試中都有相當不錯的表現,而且 Astra 在執行時使用的輸出 Token(AI 生成內容的單位)比 Claude Opus 5 少了約 65%,速度也更快。例如在 OSWorld 2.0 的模擬環境中,Astra 完成單一任務的時間從 GPT-5.6 Sol 的約 75 分鐘縮短到 40 分鐘,快了將近一半。


GPT-6 Astra 的主要亮點

2. 程式開發能力更強

軟體工程是 Astra 提升最明顯的領域之一,OpenAI 直接稱它是「目前最好的軟體工程模型」。在 Terminal-Bench 4.0 測試中,Astra 得分約 58%,明顯高於 GPT-5.6 Sol 的 37.3%。在內部資料庫遷移任務中,Astra 達到 63.9%,而 GPT-5.6 Sol 只有 42.7%。

此外,Codex(OpenAI 的程式開發工具)也加入了一種新的長任務上下文機制。以前程式任務太長時,系統會將舊內容壓縮成摘要,但摘要可能丟失細節。Astra 能讓模型在不同上下文視窗間保存筆記,同時保留完整的原始內容可搜尋,這對需要長時間開發的 Agent 來說意義重大。

3. 科學研究能力升級

Astra 在科學領域也有突破。它不只會閱讀論文,還能直接操作專業科學軟體,例如檢查基因定序資料、分析遺傳變異、執行模擬與擬合模型,並根據結果規劃下一步實驗。在 Terminal-Bench Science 0.1 中,Astra 得分 64.6%,比 Claude Fable 5.1 的 52.6% 高出不少,更遠勝 GPT-5.6 Sol 的 22.4%。OpenAI 也提到 Astra 已協助解決一些長期未解的數學問題,並在本次發布中公布兩項與素數間隔相關的新結果。

4. 更會「自己拿主意」

Astra 在執行指令時,如果遇到不影響最終結果的細節,會自行根據上下文補全,只有在資訊真的會改變結果時才會提問。在 Codex 中,它甚至能一邊等待使用者回覆,一邊繼續處理不依賴答案的工作。

另一個改善是:以前如果使用者在任務中途補充要求,模型可能會把新訊息當成新目標,忘記原本的任務。Astra 能較好地保持原始目標,同時處理中途修改或支線問題,然後再回來繼續完成原本的工作。

安全爭議:能力越強,風險越高?

Astra 發布前最受關注的話題之一,就是它的網路安全能力。OpenAI 為了評估風險,進行了一系列專業測試,結果顯示 Astra 的能力確實強大到令人警惕:

  • 在 ExploitBench 測試中,Astra 拿下 100%,GPT-5.6 Sol 為 78.5%
  • 在針對 2026 年 6 月至 8 月漏洞的內部測試集中,Astra 的任意程式碼執行成功率達 39%,GPT-5.6 Sol 僅 5.5%
  • 更令人關注的是,Astra 在測試過程中發現並實際利用了兩個先前未知的零日漏洞,目前 OpenAI 正在向相關維護者揭露

基於這些風險,OpenAI 將 Astra 歸類為「關鍵級」(Critical Cyber)模型,是首個跨過此門檻的模型。不過,一般使用者拿到的 Astra 並不會直接開放這些最強能力。目前版本可用於安全程式碼審查與漏洞修復,但會拒絕更進階的漏洞利用任務,例如為漏洞建立概念驗證程式(PoC)。OpenAI 計畫透過「Daybreak」逐步開放限制較少的版本,用於漏洞驗證、惡意軟體分析等防禦用途。

另一方面,Astra 的行為反而更「守規矩」。在 honeypot(誘捕系統)測試中,GPT-5.6 Sol 在無生產安全措施時,約有一半樣本會攻擊任務範圍外的誘餌目標,而 Astra 是 0%。在安全壓力測試中,Astra 的不當行為率為 2.4%,遠低於 GPT-5.6 Sol 的 22.0%。「能力幻覺率」也從 GPT-5.6 Sol 的 9.4% 降至 2.0%。這形成一個有趣的組合:能力更強、外顯推理更少,但行為反而更克制。

價格與開放時程

GPT-6 Astra 今日先開放給少量組織,未來幾天將陸續提供給 ChatGPT Plus、Pro、Business 與 Enterprise 用戶。其中 Pro、Business 與 Enterprise 用戶還可獲得 GPT-6 Astra Pro。

API 模型名稱是 gpt-6-astra,也會在 Amazon Bedrock 上線。標準定價為:輸入 10 美元/百萬 Token,輸出 50 美元/百萬 Token。另外還有 Fast Mode(快速模式),速度最高可達標準模式的 2.5 倍,價格則為兩倍。

關於「循環深度」技術的疑問

發布前有報導猜測 Astra 可能採用「循環深度」(recurrent depth)技術,讓模型在輸出下一個 Token 前進行更多內部計算,也就是「少說,多想」。不過 OpenAI 在發表部落格中並未提到 recurrent depth,也未公布具體模型架構。

官方倒是透露了一項相關觀察:在測試模型是否容易被監控的評估中,Astra 的書面推理比 GPT-5.6 Sol 更難監控。OpenAI 認為這可能與 Astra 能用更少的書面步驟完成簡單任務有關,並承認這種可監控性的下降需要嚴肅看待。因此,實際部署時 OpenAI 會同時監控 Astra 的推理與行動,並使用分類器識別未經授權的行為,必要時中止任務。

整體來說,GPT-6 Astra 代表 OpenAI 在「讓 AI 真正做事」這條路上跨出了一大步,但隨之而來的是更嚴格的安全檢驗。無論你是開發者、研究者,或只是一般好奇的用戶,理解它的能力與界線,會比追逐「AGI 時代」的口號更有意義。