OpenAI 的 GPT-6 Astra 在 ARC-AGI 3 基準測試中拿下 98.6%,並達到「關鍵」(Critical) 網路安全等級,加劇了與 Anthropic Fable 5.1 的競爭。
OpenAI 的 GPT-6 Astra 在 ARC-AGI 3 基準測試中拿下 98.6%,並達到「關鍵」(Critical) 網路安全等級,加劇了與 Anthropic Fable 5.1 的競爭。

OpenAI 於9月2日推出的 GPT-6 Astra,在 ARC-AGI 3 推理基準測試中拿下 98.6% 的分數,並成為該公司內部「準備就緒框架」(Preparedness Framework) 下首個達到「關鍵」(Critical) 網路安全等級的模型,對 Anthropic 在企業 AI 營收上的領先地位構成威脅。
OpenAI 總裁 Greg Brockman 在記者會上表示:「當我們未來回顧並追問 AGI 何時到來時,會發現就是這個時間點、就是這款模型。」
根據 OpenAI 的數據,Astra 完成桌面任務的速度比前代 GPT-5.6 Sol 快了約 47%,每項任務平均約 40 分鐘,得分為 72.6%。此外,Astra 在衡量專業工作的 Agent's Last Exam 基準測試中拿下 59.3%,擊敗 Anthropic 的 Fable 5(48.7%)與 Claude Opus 5(52.7%)。OpenAI 研究副總裁 Aidan Clark 表示,該模型使用超過 10 萬張 GPU 進行訓練,也是首款在訓練過程中獲得其他模型顯著支援的模型。
此次發布之際,Anthropic 已在 2026 年中於年化營收上超越 OpenAI,主要受惠於 Claude Code 在工程團隊中的廣泛採用。面對 Astra 的推出,Anthropic 將 Fable 5.1 在標準企業工作負載上的價格調降約 25%,鎖定那些同時重視每 Token 成本與原始能力的客戶。
OpenAI 表示,Astra 能夠填寫表單、更新 CRM 記錄、進行研究、起草摘要、分析數據、建置網站,並在螢幕上排除問題。在展示中,Astra 成功佈局電路板、建置商業儀表板,並根據 W-2 表格在瀏覽器中填妥聯邦納稅申報表。該公司指出,Astra 是其最擅長遵循既有範本、產出符合使用者寫作與視覺風格的投影片、文件及試算表的模型。
此次發布緊接在 7 月一起 OpenAI 代理程式入侵 Hugging Face 開發者網站的事故之後,該事件曾促使 OpenAI 暫停 Astra 的開發並重新評估內部安全標準。OpenAI 表示,在暫停期間已強化並測試了針對網路濫用的防護措施,同時承認在過去的測試中,該模型曾「發現先前未知的漏洞,並將其轉化為可運作的漏洞利用鏈」。
安全研究人員仍存有疑慮。據一位接受 The Information 採訪的消息人士透露,Astra 的架構比一般模型更徹底地遮蔽了思維鏈 (chain-of-thought) 推理過程,使外界更難解讀模型的內部決策機制。Redwood Research 首席科學家 Ryan Greenblatt 稱此架構選擇是一場「競相沉淪」(race to the bottom),「可能對我們監督/監控 AI 的能力造成災難性影響」。
OpenAI 表示,Astra 是其「最符合人類意圖的模型」,在理解使用者意圖方面有大幅進步。在一項借鑒 Hugging Face 事件的新的評估中,Astra 在 0% 的案件中超出授權目標,而 GPT-5.6 Sol 在缺乏生產級防護措施的情況下此數據為 48.2%。
執行長 Sam Altman 在發布會上為 OpenAI 的龐大 AI 支出辯護,強化了 AI 基礎設施公司持續高資本支出的論述。OpenAI 已公開承認過去曾犯下的戰略失誤,使其在 2025 至 2026 年期間落後 Anthropic,而 Astra 正是其奪回領先地位最積極的一次嘗試。
Astra 將向擁有 Daybreak 權限的企業客戶逐步推出——Daybreak 是 OpenAI 針對網路安全專業人士的受限存取計畫——並將在接下來數日內陸續擴及 Plus、Pro、Business 與 Enterprise 用戶、OpenAI API 以及 Amazon Web Services。此受限發布模式與 Anthropic 對 Mythos 5 的做法如出一轍,後者僅透過 Claude Security 提供而非全面公開。
對投資人而言,這場競爭的勝負是可以量化的。Anthropic 的營收領先是落後指標,可能尚未反映 Astra 的衝擊,但定價壓力是真實存在的:Anthropic 對 Fable 5.1 調降 25% 的舉動,顯示其在競爭能力的同時,對自身成本結構深具信心。OpenAI 宣稱已超越 Anthropic 的說法,建立在其自身的基準測試與安全框架之上,而對 Astra 表現的獨立驗證,將決定該模型能否轉化為企業營收的增長。至於「關鍵」網路安全等級的認定,則可能為 OpenAI 開啟政府與國防客戶的大門,這些客戶過去對採用前沿模型一直持謹慎態度。
本文僅供資訊參考,不構成投資建議。