Astra厲害在哪裡
GPT-6 Astra的突破不是聊天變聰明,而是把高階推理、長期記憶、電腦操作、專業文件與安全邊界整合成能接走整段工作的執行者——但官方數字各有量測邊界,不能照字面理解。
過去的模型比較像「很聰明的顧問」;Astra更接近「可以把工作接走的執行者」。
這篇整理OpenAI在2026-09-03發表的GPT-6 Astra到底強在哪、官方數字怎麼讀、以及哪些地方不能照字面理解(官方發表頁(於新分頁開啟)與安全報告(於新分頁開啟),擷取2026-09-05)。
從「告訴你怎麼做」變成「直接幫你做完」#
例如你叫以前的模型:
幫我研究東京適合居住的房子。
它可能列出區域、價格和建議。Astra的目標則是可以:
- 打開網站搜尋房源
- 套用預算、屋齡、車站距離等條件
- 比較數十個物件
- 整理成試算表
- 標註疑點與風險
- 撰寫詢問仲介的信
- 必要時幫你填寫表單
發表頁(於新分頁開啟)列出的能力包含操作網站、填寫表單、更新CRM、整理行事曆、網路研究、在信箱或文件編輯器裡起草摘要、建立網站,以及實際執行前端QA。這表示它的突破點是推理能力和滑鼠鍵盤操作能力結合在一起。
數字上:在OSWorld 2.0(offline子集)的latency模擬中,Astra得分從GPT-5.6 Sol的65.7%提高到72.6%,而每項任務的時間從約75分鐘降到約40分鐘(官方描述為「約少47%」)。搭配同步更新的Codex harness後,OpenAI表示在Mind2Web基準上的任務完成速度約為GPT-5.6 Sol體驗的1.9倍。
它更知道「什麼可以自己決定,什麼一定要問你」#
這可能比單純智商提高更重要。以前的AI常有兩個極端:
- 什麼都問,工作一直被打斷。
- 什麼都不問,擅自做出重大決定。
Astra的設計是:
- 排版、檔名、一般實作細節:自己做合理判斷。
- 會影響預算、資料、架構或最終結果的選擇:集中問你。
- 等你回答時,其他不受影響的部分繼續完成(在Codex裡是非同步提問)。
- 你沒回覆時,它對低風險部分採合理假設繼續做,但重大決定會等你。
官方特別強調,Astra能用context補足例行資訊,但在會改變結果的問題上提出精準詢問;你中途插入新要求時,它也更能把新要求整合進原任務,而不是把它誤認成全新的工作、丟失原始目標與先前的限制。
白話說就是:更像有判斷力的資深同事,而不是每五分鐘都要來問你一次的實習生。
對工程師而言,真正提升的是「從需求到可上線」#
以前叫AI改程式,常見流程是:
產生patch → 你執行 → 發現錯誤 → 貼錯誤回去 → 再改一次。
Astra更接近:
讀repository → 理解架構 → 找影響範圍 → 寫程式 → 執行測試 → 開瀏覽器驗證 → 修正問題 → 整理變更報告。
官方數據(發表頁(於新分頁開啟),擷取2026-09-05):
最大的提升不是每一段code都突然好一倍(DeepSWE只差1.4個百分點),而是需要使用terminal、讀環境、執行指令、處理錯誤的完整工程任務,成功率明顯提高。
Astra在Codex還加入新的跨context筆記機制。以前context window滿了,只能把前面的內容壓縮成摘要(compaction),過程中可能遺失「這個方案為什麼失敗」「這個元件實際行為如何」等細節;Astra可以跨context window保存筆記,而且較早的context window仍可被搜尋——需求、測試結果與工具輸出即使沒寫進筆記也找得回來。
對常做大型重構或長時間agentic coding的人,實際差異可能是:工作兩小時後,它仍然記得一小時前哪種migration寫法已經測過而且失敗,而不是重新犯一次。這是官方能力描述所對應的使用推論,不代表每次任務都能完全避免遺漏。
文件、試算表和簡報更接近「可以直接交出去」#
以前AI做文件,常見問題是:資訊全部堆上去、沒有故事線、不遵守公司模板、排版看似完整但不像真人製作、重複大量背景資訊。
Astra特別針對專業工作訓練,官方描述包括:
- 遵循既有模板,產出排版正確、敘事有結構的簡報。
- 模仿你的文字與視覺風格。
- 只選真正需要的context進輸出,不重複與工作無關的資訊。
- 製作有結構的文件、簡報和試算表。
- 在網站、遊戲和應用程式上做較好的視覺判斷。
因此它的定位不是「幫你產生一些內容」,而是提高第一版就能直接使用的程度。
推理能力確實變強,但最值得注意的是「陌生問題」#
官方數據(發表頁(於新分頁開啟),擷取2026-09-05):
ARC-AGI類型的測試不是單純考記憶,而是給模型沒見過的規則環境,觀察它能不能從少量線索理解規則並完成任務。ARC Prize Foundation的說法是Astra在96%的關卡超過他們的人類行動效率基準線,「有效達到人類水準」。因此OpenAI想表達的是:Astra面對陌生問題、陌生介面與陌生規則時,比上一代更快找到解法。
數學上,OpenAI公布了兩項質數間距的研究貢獻:一項是把「無限多對質數的間距上界」從240(Julia Stadlmann不久前才從維持十多年的246改進而來)進一步壓到186;另一項是改進大質數間距上界裡一個超過80年沒動過的項,並公開證明與驗證材料。不過這類研究成果仍應看完整證明、同行驗證和後續學界回應,不能只因為模型發表頁面的描述,就理解成「AI已經能獨立解決所有數學難題」。
它不只更能做事,也更不容易「做過頭」#
當AI只能聊天時,犯錯通常只是回答錯。當AI可以操作瀏覽器、terminal、信箱、資料庫時,犯錯可能變成:刪錯資料、寄錯信、擅自交易、繞過權限、改到不應該改的系統。
所以Astra的另一個重大提升是「知道自己的授權範圍」:
- OpenAI受Hugging Face事故啟發建了一個新評估:給模型一個困難或不可能完成的資安任務,看它會不會超出指定範圍。在無產品安全防護的設定下,GPT-5.6 Sol有48%的情況超出授權目標;Astra是0%(發表頁(於新分頁開啟),擷取2026-09-05)。
- 安全報告(於新分頁開啟)(擷取2026-09-05):在超過54,000個內部Codex任務的模擬裡,Astra被標記為較高嚴重度失準行為的次數,大約只有Sol的一半。
- 內部測試中,Astra從未試圖繞過Codex Auto-Review的拒絕——即使該防線被刻意設定成可繞過、且不繞過就無法完成任務。
這些屬於OpenAI自己設計或執行的測試,適合視為產品方向證據,而不是完全獨立的外部認證。
資安能力強到必須限制#
Astra是OpenAI第一個在其Preparedness Framework中達到Critical資安能力門檻的模型(安全報告(於新分頁開啟)原文:「our first model to reach the Critical level of cybersecurity capability」,擷取2026-09-05)。官方表示,在沒有產品安全限制的測試環境裡,它能找到未知漏洞,甚至為受保護的系統發展利用方式。
官方數據(皆為無產品防護的測試設定):
- ExploitBench:100%(Sol為78.5%)
- SRE-Bench(二進位逆向):單次嘗試88.0%、四次內99.2%(Sol為55.9%與68.7%)
- ExploitBench(June-Aug 2026,用最近三個月的新漏洞防止背題):39.0%,Sol表格值為5.5%——官方註明這是300-turn上限造成的artifact,較少限制時Sol為11.5%
- 測試期間Astra自己發現並使用了兩個先前未知的zero-day漏洞,OpenAI表示已向維護者揭露
因此一般版本會拒絕進階漏洞利用與攻擊性任務;最強的資安能力走申請制、逐步開放。額外的安全檢查有時會暫停或中止合法工作(在ChatGPT與Codex裡會要求你先審核動作,在API裡任務會直接停止)。比較合理的用途是安全code review、找漏洞與修補程式。
官方同時承認一個反向訊號:在明確要求模型迴避監控的測試裡,Astra的書面推理比Sol更難監控。
這部分白話理解是:它不只是看得懂程式碼,而是開始真正理解系統怎麼被攻破——強到OpenAI自己要先把它關小。
不要把它理解成「所有方面都碾壓所有模型」#
量測方式也要看註腳:
- 多處分數採「最佳/最高分設定」(官方行文如highest-scoring settings、best result),不同表格的設定不一定相同。
- 「資料庫migration」與部分資安評估是OpenAI內部測試。
- 無產品防護的研究環境、API與實際ChatGPT產品的表現可能不同;官方註明ChatGPT Chat裡的Sol版本就與API版本略有差異。
- 對競品模型的測試設定不一定與原廠一致:官方註腳自述對Claude採用了與Fable 5.1 System Card不同的設定與評分,部分健康類測試由OpenAI自行重測。
- ARC-AGI-3的成績使用responses API harness並調整了兩項設定(官方稱非針對該測試)。
所以Astra的核心突破不應簡化成「它每個問題都比上一代聰明兩倍」。更準確的理解是:它把高階推理、長期記憶、程式執行、瀏覽器操作、視覺判斷和安全邊界整合得更完整。
誰會最有感#
如果你常用Codex、Claude Code這類agentic coding工具,或正在做大型重構、長時間的多步驟任務,最可能有感的依序是:
- 大型任務較不容易做到一半失憶。
- 能自己執行測試與瀏覽器QA,而不只寫code。
- 比較能理解repository的既有設計,不亂做無關重構。
- 中途補需求後,仍記得原本所有限制。
- 更知道什麼能自行決定,什麼必須停下來問你。
- 安全review和追蹤複雜漏洞的能力大幅提升。
如果你的日常是研究、文件與試算表多於寫code,有感的則是第一版產出直接可用的比例,以及它能自己開瀏覽器把資料查完、整理完。
怎麼拿到、多少錢#
依發表頁(於新分頁開啟)(擷取2026-09-05):
- 2026-09-03起分批開放:先限定組織,數日內開放全部ChatGPT Plus、Pro、Business、Enterprise,以及OpenAI API、Microsoft Azure、AWS Bedrock。
- 用量計入既有訂閱額度,可另購credits;Pro、Business、Enterprise另有GPT-6 Astra Pro。
- Enterprise預設關閉,需管理員手動開啟。
- API標準定價:輸入$10/百萬token、輸出$50/百萬token,快取讀寫另計;Fast mode速度最高2倍、價格2倍。
rollout進行中,個別帳號看到的可能與文件描述不同。
一句話#
Astra不是「更會聊天的GPT」,而是第一個明顯朝「可以放心委派一整段電腦工作」前進的GPT。