GPT-6 Astra有多强?AI Agent迈向自主完成工作


OpenAI 正式发布新一代旗舰AI 模型GPT-6 Astra,将能力重点从单纯的问答与推理,进一步推向AI Agent、电脑操作(Computer Use)、专业工作、科学研究、程式开发与资安,让AI 不只回答问题,也能操作电脑与工具完成多步骤工作。

OpenAI 执行长Sam Altman表示,希望GPT-6 Astra 能催生新一代的创业、科学发现与创造,并称OpenAI 相信Astra 是目前在电脑操作、专业工作、科学、程式开发与网路安全等领域表现最好的模型。

Benchmark 方面,GPT-6 Astra 在ARC-AGI-3 达99.9%、FrontierMath Tier 4 达97.6%,ExploitBench 更取得100%。其中资安能力首次触及OpenAI Preparedness Framework 的Critical 门槛;另一方面,Astra 也开始把Computer Use、Coding、Web Search、MCP 与Skills 等工具整合进长时间Agent 工作流程,模型竞争正从「回答问题」进一步转向「完成工作」。

GPT-6 Astra 最大升级是什么? AI 开始直接「做完工作」

如果说过去大型语言模型主要竞争的是「回答得多聪明」,GPT-6 Astra 更重要的方向则是能不能把工作真正完成。

OpenAI 表示,Astra 能直接操作电脑与浏览器,例如填写线上表格、更新CRM 客户资料、整理行事历、进行网路研究,再把结果写进电子邮件或文件;更复杂的工作还包括分析科学资料、绘制图表、建立网站,以及完成前端QA 测试。

在OSWorld 2.0 电脑操作测试中,GPT-6 Astra 得分达72.6%,高于GPT-5.6 Sol 的65.7%;同时平均完成任务所需时间约40 分钟,GPT-5.6 Sol 则约为75 分钟,相当于时间缩短约47%。

另一项模拟真实专业软体工作的Agents' Last Exam,Astra 得分59.3%,也高于Claude Opus 5 的55.5% 与GPT-5.6 Sol 的53.6%。 OpenAI 表示,在最高分设定下,Astra 使用的输出token 还比Claude Opus 5 少约65%。

这让GPT-6 Astra 的定位更接近一个能自主执行工作的通用AI Agent,而不只是聊天机器人。

GPT-6 Astra 程式能力提升,Codex 还能「跨Context Window 记忆」

程式开发同样是GPT-6 Astra 的主要升级项目。

在Terminal-Bench 4.0 中,Astra 得分从GPT-5.6 Sol 的37.3% 提升至57.9%;DeepSWE v1.1 则取得74.1%。不过并非所有程式测试都由Astra取得第一,例如Artificial Analysis Coding Agent Index 中,Astra 得分67.0,仍略低于Claude Opus 5 的68.1。

GPT-6 Astra 在Codex 中新增一种保存与重新取得Context 的方式。过去Agent 执行大型重构或长时间除错时,Context Window 填满后通常需要透过compaction 压缩先前内容,过程可能遗失「某个方法为什么失败」等细节。

Astra 则能跨Context Window 保留工作笔记,同时让较早以前的Context 保持可搜寻,使模型可以重新找回先前的需求、测试结果与工具输出。

这项改变的意义在于,AI Coding Agent 能执行的任务可能进一步从「一次性的程式生成」,走向持续数小时甚至更长时间的软体工程工作。

ARC-AGI-3 从7.8% 暴增至99.9%,GPT-6 Astra 推理能力大幅跃进

GPT-6 Astra 最惊人的Benchmark 之一来自ARC-AGI。

根据OpenAI 公布结果:

  • ARC-AGI-3:99.9%,GPT-5.6 Sol 为7.8%
  • ARC-AGI-2:95.0%,GPT-5.6 Sol 为92.5%
  • FrontierMath Tier 4:97.6%,GPT-5.6 Sol 为83.0%
  • GPQA Diamond:96.0%,GPT-5.6 Sol 为94.6%
  • Terminal-Bench Science:64.6%,GPT-5.6 Sol 为22.4%

ARC-AGI-3 尤其值得注意。这套测试希望衡量AI 面对陌生环境时的抽象推理与适应能力,OpenAI 公布的Astra 成绩几乎达到满分。

ARC Prize 也另外公布Astra 测试结果,称GPT-6 Astra 在ARC-AGI-3 创下目前最佳成绩,并指出较高reasoning level 虽然投入更多推理能力,却可能因为模型能以更少操作解决问题,而降低整体模型呼叫与token 使用量。

不过Benchmark 接近饱和并不等于「AGI 已被证明」,尤其不同测试的harness、工具与执行条件都会影响结果。 OpenAI 自己也注明,其评测是在研究环境或API 执行,与实际ChatGPT 产品中的模型表现可能存在差异。

GPT-6 Astra 已能找到Zero-day,首次达OpenAI 资安「Critical」等级

能力提升同时带来另一个问题:Astra 已经强到OpenAI 必须限制部分能力的使用方式。

GPT-6 Astra 是OpenAI 首款在Preparedness Framework 中,资安能力达到Critical(关键)门槛的模型。

在没有产品安全限制的测试环境下,Astra 于ExploitBench 取得100%,相比GPT-5.6 Sol 为78.5%;ExploitGym 则为42.4%,高于Sol 的30.3%。

更值得注意的是,OpenAI 表示Astra 在测试期间甚至发现并利用了两个此前未知的Zero-day 漏洞,目前正向相关维护者揭露漏洞。

在SRE-Bench 逆向工程测试中,Astra 首次尝试即可解决88% 任务,四次尝试内更达到99.2%。专家测试还发现,未套用产品安全措施的Astra,可以利用未知漏洞在经过强化的浏览器中达成任意程式码执行。

因此,正式推出的Astra 仍会拒绝部分进阶攻击性资安任务,例如替漏洞建立Proof-of-Concept exploit。 OpenAI 预计透过Daybreak 计划逐步向可信任的资安研究者开放更多能力。

能力更强却更难监控? OpenAI 坦承Astra 的推理可监控性下降

GPT-6 Astra 的另一个重要讯号,反而来自OpenAI 主动揭露的限制。

OpenAI 表示,Astra 整体而言比GPT-5.6 Sol 更能遵守使用者授权范围。在一项根据先前Hugging Face 事件设计的内部测试中,没有产品安全机制的GPT-5.6 Sol 有48% 机率超出授权目标,而Astra 为0%。

但另一方面,OpenAI 发现Astra 的书面推理过程反而比GPT-5.6 Sol 更难监控。

在刻意要求模型躲避监控的对抗测试中,Astra 对自己的推理内容具有更强控制能力,也更可能避免留下可被监控系统辨识的讯号。 OpenAI 因此强调,未来不能只依赖Chain of Thought 监控模型,而需要发展其他Alignment auditing 方法。

这形成前沿AI 发展的一个新矛盾:模型越聪明、越能自主完成长时间工作,人类可能也越难单纯从它写出的推理过程判断它究竟在做什么。

GPT-6 Astra 何时可以用? Plus、Pro 将陆续开放

GPT-6 Astra 首波先向有限数量的组织推出,OpenAI 表示,接下来几天将逐步提供给ChatGPT Plus、Pro、Business 与Enterprise 使用者,同时登陆OpenAI API 与AWS。

Pro、Business 与Enterprise 用户还将获得GPT-6 Astra Pro 使用权;Enterprise 管理员则需要自行为Workspace 开启Astra,发布初期预设关闭。

API 模型名称为`gpt-6-astra`,Standard 模式价格为:

  • 输入:每100 万Token 10 美元
  • 输出:每100 万Token 50 美元

另外还有最高可达Standard 两倍速度的Fast mode,价格同样为Standard 的两倍。

GPT-6 Astra 的Context Window 更扩大至105 万Token,单次最高输出12.8 万Token。这也与OpenAI 对Astra 的产品定位一致:不再只是追求一次Prompt 的回答品质,而是希望模型能接收庞大工作背景,持续操作工具并完成端到端任务。

GPT-6 Astra 上线出包,Sam Altman 出面道歉

不过,想立刻使用GPT-6 Astra 的ChatGPT 付费用户可能还得再等等。

GPT-6 Astra 发布后的rollout 并不顺利。 OpenAI 执行长Sam Altman 随后公开为混乱的上线过程道歉,表示「当我们搞砸事情时,我们会努力把它修好」,并透露OpenAI 应该能在不久后开始向API 客户与ChatGPT 订阅用户大规模开放Astra。

Altman 引用OpenAI 团队成员Tibo 的贴文表示,团队正在全力加快Astra 的开放速度。 Tibo 称,从发布当天开始,付费ChatGPT 用户每晚一天没有取得Astra 使用权,就会获得一次可累积(banked)的reset,作为rollout 延迟的补偿。

本文链接地址:https://www.wwsww.cn/rgzn/41011.html
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。