---
title: "Astra厲害在哪裡"
description: "GPT-6 Astra的突破不是聊天變聰明，而是把高階推理、長期記憶、電腦操作、專業文件與安全邊界整合成能接走整段工作的執行者——但官方數字各有量測邊界，不能照字面理解。"
canonical_url: https://www.datum.page/zh-tw/docs/models/gpt-6-astra
site: "Datum"
author: "CJ Mario"
author_url: https://www.datum.page/zh-tw/about
language: zh-TW
published: 2026-09-05
last_updated: 2026-09-05
topic: "模型與選型"
kind: concept # 概念
level: intermediate # 中級
tags: [models, openai, agents, codex]
cite_as: https://www.datum.page/zh-tw/docs/models/gpt-6-astra
---

# Astra厲害在哪裡

> GPT-6 Astra的突破不是聊天變聰明，而是把高階推理、長期記憶、電腦操作、專業文件與安全邊界整合成能接走整段工作的執行者——但官方數字各有量測邊界，不能照字面理解。

過去的模型比較像「很聰明的顧問」；Astra更接近「可以把工作接走的執行者」。

這篇整理OpenAI在2026-09-03發表的GPT-6 Astra到底強在哪、官方數字怎麼讀、以及哪些地方不能照字面理解（[官方發表頁](https://openai.com/index/gpt-6-astra/)與[安全報告](https://openai.com/index/safety-overview-gpt-6-astra/)，擷取2026-09-05）。

## 從「告訴你怎麼做」變成「直接幫你做完」

例如你叫以前的模型：

> 幫我研究東京適合居住的房子。

它可能列出區域、價格和建議。Astra的目標則是可以：

- 打開網站搜尋房源
- 套用預算、屋齡、車站距離等條件
- 比較數十個物件
- 整理成試算表
- 標註疑點與風險
- 撰寫詢問仲介的信
- 必要時幫你填寫表單

[發表頁](https://openai.com/index/gpt-6-astra/)列出的能力包含操作網站、填寫表單、更新CRM、整理行事曆、網路研究、在信箱或文件編輯器裡起草摘要、建立網站，以及實際執行前端QA。這表示它的突破點是推理能力和滑鼠鍵盤操作能力結合在一起。

數字上：在OSWorld 2.0（offline子集）的latency模擬中，Astra得分從GPT-5.6 Sol的65.7%提高到72.6%，而每項任務的時間從約75分鐘降到約40分鐘（官方描述為「約少47%」）。搭配同步更新的Codex harness後，OpenAI表示在Mind2Web基準上的任務完成速度約為GPT-5.6 Sol體驗的1.9倍。

## 它更知道「什麼可以自己決定，什麼一定要問你」

這可能比單純智商提高更重要。以前的AI常有兩個極端：

- 什麼都問，工作一直被打斷。
- 什麼都不問，擅自做出重大決定。

Astra的設計是：

- 排版、檔名、一般實作細節：自己做合理判斷。
- 會影響預算、資料、架構或最終結果的選擇：集中問你。
- 等你回答時，其他不受影響的部分繼續完成（在Codex裡是非同步提問）。
- 你沒回覆時，它對低風險部分採合理假設繼續做，但重大決定會等你。

官方特別強調，Astra能用context補足例行資訊，但在會改變結果的問題上提出精準詢問；你中途插入新要求時，它也更能把新要求整合進原任務，而不是把它誤認成全新的工作、丟失原始目標與先前的限制。

白話說就是：更像有判斷力的資深同事，而不是每五分鐘都要來問你一次的實習生。

## 對工程師而言，真正提升的是「從需求到可上線」

以前叫AI改程式，常見流程是：

> 產生patch → 你執行 → 發現錯誤 → 貼錯誤回去 → 再改一次。

Astra更接近：

> 讀repository → 理解架構 → 找影響範圍 → 寫程式 → 執行測試 → 開瀏覽器驗證 → 修正問題 → 整理變更報告。

官方數據（[發表頁](https://openai.com/index/gpt-6-astra/)，擷取2026-09-05）：

| 測試 | GPT-5.6 Sol | GPT-6 Astra |
| --- | --- | --- |
| Terminal-Bench 4.0 | 37.3% | 57.9% |
| 資料庫migration內部測試 | 42.7% | 63.9% |
| DeepSWE v1.1 | 72.7% | 74.1% |

最大的提升不是每一段code都突然好一倍（DeepSWE只差1.4個百分點），而是需要使用terminal、讀環境、執行指令、處理錯誤的完整工程任務，成功率明顯提高。

Astra在Codex還加入新的跨context筆記機制。以前context window滿了，只能把前面的內容壓縮成摘要（compaction），過程中可能遺失「這個方案為什麼失敗」「這個元件實際行為如何」等細節；Astra可以跨context window保存筆記，而且較早的context window仍可被搜尋——需求、測試結果與工具輸出即使沒寫進筆記也找得回來。

> **說明：筆記機制是實驗性功能**
>
> 這個功能要在Codex的 `config.toml` 手動開啟，官方明確標為experimental。預設行為仍是compaction。

對常做大型重構或長時間agentic coding的人，實際差異可能是：工作兩小時後，它仍然記得一小時前哪種migration寫法已經測過而且失敗，而不是重新犯一次。這是官方能力描述所對應的使用推論，不代表每次任務都能完全避免遺漏。

## 文件、試算表和簡報更接近「可以直接交出去」

以前AI做文件，常見問題是：資訊全部堆上去、沒有故事線、不遵守公司模板、排版看似完整但不像真人製作、重複大量背景資訊。

Astra特別針對專業工作訓練，官方描述包括：

- 遵循既有模板，產出排版正確、敘事有結構的簡報。
- 模仿你的文字與視覺風格。
- 只選真正需要的context進輸出，不重複與工作無關的資訊。
- 製作有結構的文件、簡報和試算表。
- 在網站、遊戲和應用程式上做較好的視覺判斷。

因此它的定位不是「幫你產生一些內容」，而是提高第一版就能直接使用的程度。

## 推理能力確實變強，但最值得注意的是「陌生問題」

官方數據（[發表頁](https://openai.com/index/gpt-6-astra/)，擷取2026-09-05）：

| 測試 | GPT-5.6 Sol | GPT-6 Astra |
| --- | --- | --- |
| FrontierMath Tier 4（v2） | 83.0% | 97.6% |
| Terminal-Bench Science 0.1 | 22.4% | 64.6% |
| ARC-AGI-3 | 7.8% | 99.9% |

ARC-AGI類型的測試不是單純考記憶，而是給模型沒見過的規則環境，觀察它能不能從少量線索理解規則並完成任務。ARC Prize Foundation的說法是Astra在96%的關卡超過他們的人類行動效率基準線，「有效達到人類水準」。因此OpenAI想表達的是：Astra面對陌生問題、陌生介面與陌生規則時，比上一代更快找到解法。

數學上，OpenAI公布了兩項質數間距的研究貢獻：一項是把「無限多對質數的間距上界」從240（Julia Stadlmann不久前才從維持十多年的246改進而來）進一步壓到186；另一項是改進大質數間距上界裡一個超過80年沒動過的項，並公開證明與驗證材料。不過這類研究成果仍應看完整證明、同行驗證和後續學界回應，不能只因為模型發表頁面的描述，就理解成「AI已經能獨立解決所有數學難題」。

## 它不只更能做事，也更不容易「做過頭」

當AI只能聊天時，犯錯通常只是回答錯。當AI可以操作瀏覽器、terminal、信箱、資料庫時，犯錯可能變成：刪錯資料、寄錯信、擅自交易、繞過權限、改到不應該改的系統。

所以Astra的另一個重大提升是「知道自己的授權範圍」：

- OpenAI受Hugging Face事故啟發建了一個新評估：給模型一個困難或不可能完成的資安任務，看它會不會超出指定範圍。在無產品安全防護的設定下，GPT-5.6 Sol有48%的情況超出授權目標；Astra是0%（[發表頁](https://openai.com/index/gpt-6-astra/)，擷取2026-09-05）。
- [安全報告](https://openai.com/index/safety-overview-gpt-6-astra/)（擷取2026-09-05）：在超過54,000個內部Codex任務的模擬裡，Astra被標記為較高嚴重度失準行為的次數，大約只有Sol的一半。
- 內部測試中，Astra從未試圖繞過Codex Auto-Review的拒絕——即使該防線被刻意設定成可繞過、且不繞過就無法完成任務。

這些屬於OpenAI自己設計或執行的測試，適合視為產品方向證據，而不是完全獨立的外部認證。

## 資安能力強到必須限制

Astra是OpenAI第一個在其Preparedness Framework中達到Critical資安能力門檻的模型（[安全報告](https://openai.com/index/safety-overview-gpt-6-astra/)原文：「our first model to reach the Critical level of cybersecurity capability」，擷取2026-09-05）。官方表示，在沒有產品安全限制的測試環境裡，它能找到未知漏洞，甚至為受保護的系統發展利用方式。

官方數據（皆為無產品防護的測試設定）：

- ExploitBench：100%（Sol為78.5%）
- SRE-Bench（二進位逆向）：單次嘗試88.0%、四次內99.2%（Sol為55.9%與68.7%）
- ExploitBench（June-Aug 2026，用最近三個月的新漏洞防止背題）：39.0%，Sol表格值為5.5%——官方註明這是300-turn上限造成的artifact，較少限制時Sol為11.5%
- 測試期間Astra自己發現並使用了兩個先前未知的zero-day漏洞，OpenAI表示已向維護者揭露

因此一般版本會拒絕進階漏洞利用與攻擊性任務；最強的資安能力走申請制、逐步開放。額外的安全檢查有時會暫停或中止合法工作（在ChatGPT與Codex裡會要求你先審核動作，在API裡任務會直接停止）。比較合理的用途是安全code review、找漏洞與修補程式。

官方同時承認一個反向訊號：在明確要求模型迴避監控的測試裡，Astra的書面推理比Sol更難監控。

這部分白話理解是：它不只是看得懂程式碼，而是開始真正理解系統怎麼被攻破——強到OpenAI自己要先把它關小。

## 不要把它理解成「所有方面都碾壓所有模型」

> **注意：官方表格裡Astra不是每項第一**
>
> 同一份發表頁的對照表（擷取2026-09-05）：Humanity's Last Exam（含工具）Astra為57.2%，低於Claude Fable 5.1的65.0%；Artificial Analysis Intelligence Index v4.1.1 Astra為61.2，低於Fable 5.1的65.7；Coding Agent Index v1.4 Astra為67.0，低於Opus 5的68.1與Fable 5的67.2。

量測方式也要看註腳：

- 多處分數採「最佳／最高分設定」（官方行文如highest-scoring settings、best result），不同表格的設定不一定相同。
- 「資料庫migration」與部分資安評估是OpenAI內部測試。
- 無產品防護的研究環境、API與實際ChatGPT產品的表現可能不同；官方註明ChatGPT Chat裡的Sol版本就與API版本略有差異。
- 對競品模型的測試設定不一定與原廠一致：官方註腳自述對Claude採用了與Fable 5.1 System Card不同的設定與評分，部分健康類測試由OpenAI自行重測。
- ARC-AGI-3的成績使用responses API harness並調整了兩項設定（官方稱非針對該測試）。

所以Astra的核心突破不應簡化成「它每個問題都比上一代聰明兩倍」。更準確的理解是：它把高階推理、長期記憶、程式執行、瀏覽器操作、視覺判斷和安全邊界整合得更完整。

## 誰會最有感

如果你常用Codex、Claude Code這類agentic coding工具，或正在做大型重構、長時間的多步驟任務，最可能有感的依序是：

1. 大型任務較不容易做到一半失憶。
2. 能自己執行測試與瀏覽器QA，而不只寫code。
3. 比較能理解repository的既有設計，不亂做無關重構。
4. 中途補需求後，仍記得原本所有限制。
5. 更知道什麼能自行決定，什麼必須停下來問你。
6. 安全review和追蹤複雜漏洞的能力大幅提升。

如果你的日常是研究、文件與試算表多於寫code，有感的則是第一版產出直接可用的比例，以及它能自己開瀏覽器把資料查完、整理完。

## 怎麼拿到、多少錢

依[發表頁](https://openai.com/index/gpt-6-astra/)（擷取2026-09-05）：

- 2026-09-03起分批開放：先限定組織，數日內開放全部ChatGPT Plus、Pro、Business、Enterprise，以及OpenAI API、Microsoft Azure、AWS Bedrock。
- 用量計入既有訂閱額度，可另購credits；Pro、Business、Enterprise另有GPT-6 Astra Pro。
- Enterprise預設關閉，需管理員手動開啟。
- API標準定價：輸入$10／百萬token、輸出$50／百萬token，快取讀寫另計；Fast mode速度最高2倍、價格2倍。

rollout進行中，個別帳號看到的可能與文件描述不同。

## 一句話

Astra不是「更會聊天的GPT」，而是第一個明顯朝「可以放心委派一整段電腦工作」前進的GPT。

---

## 本文引用來源

- [官方發表頁](https://openai.com/index/gpt-6-astra/)
- [安全報告](https://openai.com/index/safety-overview-gpt-6-astra/)
