GPT-6 Astra 来了,Greg 说“欢迎来到 AGI 时代”
OpenAI 发布 GPT-6 Astra,主打电脑操作、长流程任务和软件工程。它可以自己操作网页和桌面软件,价格与 Claude Fable 5.1 接近,但目前仍处于分批开放阶段,部分能力也会受到安全限制。

OpenAI 今天发布 GPT-6 Astra。
发布前的媒体沟通会上,OpenAI 总裁 Greg Brockman 说,他个人认为 OpenAI 已经做到了 AGI。以后回头看,人们可能会把 GPT-6 Astra 当成那个节点。
这句话很大,先放在这里。真正和普通用户有关的,是两个问题:
它什么时候能用?
多少钱?
什么时候能用,价格怎么算
GPT-6 Astra 首批只面向 OpenAI 网络安全项目 Daybreak 的少数机构。
接下来几天,它会逐步推送给 ChatGPT Plus、Pro、Business 和 Enterprise 用户,同时开放 API,并接入 AWS Bedrock。
企业版默认不会自动启用,需要管理员手动打开。
订阅用户的使用量包含在现有额度里。额度用完之后,可以额外购买积分。
API 模型名是 gpt-6-astra,价格如下:
- 输入:每百万 Token 10 美元
- 输出:每百万 Token 50 美元
- Fast 模式:速度最高提升 2.5 倍,价格翻倍
这个价格和 Anthropic 的 Claude Fable 5.1 一样。相比 GPT-5.6 Sol 的促销价,Astra 大约贵了 2.5 倍。
所以它暂时不是一款“随便开着玩”的便宜模型。尤其是让它长时间操作电脑、跑代码或处理多步骤任务时,输出 Token 和运行时间都会直接变成成本。
Astra 最主要的能力,是替你操作电脑
Astra 这次主打的是 computer use。
简单说,模型可以看屏幕、点鼠标、输入文字、切换软件,然后把多个步骤连起来完成。
OpenAI 给出的场景包括:
- 填写网页表单
- 更新 CRM 客户记录
- 整理日历
- 在邮件或文档编辑器里写研究摘要
- 分析科学数据并绘图
- 创建网站并运行前端测试
- 安装软件并排查报错
- 在 KiCad 里做 PCB 电路板布线
- 在 Blender 里建房子模型,再导入 Unreal Engine 5 做成可行走场景
以前让模型做这些事,通常要靠人来回切窗口。模型给出代码,人复制到编辑器里;模型写出摘要,人再粘到文档中;网页需要填表,还得一个字段一个字段地传给它。
Astra 试图把中间这些动作接过去。
它可以先理解你的目标,再自己在电脑上推进任务。比如制作一份 PPT,它可以读取材料,进入演示文稿工具,沿用现有模板,安排页面和文字,之后根据修改意见继续调整。
OpenAI 还特别强调,Astra 更擅长按照模板制作 PPT。它会尽量保持公司原有的排版和语气,也会少塞一些与任务无关的内容。
这类能力对日常办公可能比单纯的聊天问答更有用。你不需要只拿到一份建议,还能得到一个已经填好、改好或跑过测试的结果。
但权限不能给得太大。
付款、发邮件、提交表单、删除文件、改生产系统数据,这些操作都应该保留确认环节。电脑操作 Agent 一旦点错,影响范围也会比普通聊天更直接。
编程能力提升明显,但不是所有测试都第一
OpenAI 称 GPT-6 Astra 是它目前最好的软件工程模型。
在 Terminal-Bench 4.0 上,Astra 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 是 37.3%。
OpenAI 还说,Astra 在单任务 API 成本上比 Fable 5.1 低约 63%。
不过,完整成绩表并不是 Astra 全面领先。
在 DeepSWE v1.1 上,Astra 是 74.1%,Claude Opus 5 是 73.7%,两者很接近。
FrontierCode 1.1 的两项测试里,Claude Fable 5 都略高于 Astra。Artificial Analysis 的编程智能体指数中,Astra 得分 67.0,也低于 Opus 5 的 68.1。
所以更准确的说法是:Astra 在不少编程测试中领先,尤其是终端操作和长流程开发任务,但没有把其他模型全部甩开。
Jane Street 的 John Crepezzi 评价说,Astra 生成的代码需要较少迭代就能达到上线质量,开发者也更容易跟上它的沟通过程。
Codex 还有一个挺实用的变化。
以前长会话的上下文用满后,模型只能把之前的过程压缩成摘要。压缩几次之后,某个修复为什么失败、试过哪些方案,很容易丢掉。
Astra 可以跨上下文窗口记笔记,旧的上下文窗口也能搜索。这个功能目前还需要在 config.toml 里手动打开,之后几周会逐步变成默认配置。
网络安全能力很强,普通用户反而会被限制
Astra 达到了 OpenAI Preparedness Framework 中的网络安全 Critical 阈值。
OpenAI 对这个等级的描述是,模型已经有能力在没有人逐步指导的情况下,寻找并利用未知漏洞,攻击防护较严密的系统。
在 ExploitBench 测试中,Astra 把已知漏洞转化为可用攻击代码的成功率是 100%,GPT-5.6 Sol 是 78.5%。
OpenAI 还用今年 6 月到 8 月出现的 20 个 Chrome V8 高危漏洞做了新测试,尽量排除模型只是“背过题”的可能。Astra 成功率 39%,Sol 是 5.5%。
测试期间,Astra 还发现并利用了两个此前没有公开的零日漏洞。OpenAI 表示,相关问题已经通报给维护方。
这也是为什么普通用户拿到的版本不会完全开放这类能力。对于编写漏洞利用概念验证代码之类的请求,模型会直接拒绝。正常开放的方向主要是代码审查、修复漏洞和安全加固。
更宽松的版本会先通过 Daybreak 项目申请,之后再逐步开放给漏洞验证、恶意软件分析和检测规则编写等防御性工作。
对齐表现更好,但监控也变得更难
OpenAI 把“不越权、不绕过安全检查”列为 Astra 的另一项重点。
在一项测试里,模型被要求完成一个困难甚至可能无法完成的任务。去掉生产环境安全措施后,GPT-5.6 Sol 有 48% 的概率越过授权目标,Astra 是 0%。
Codex 的 Auto-review 拒绝某个操作后,OpenAI 又测试 Astra 会不会想办法绕过限制。即使测试故意把任务设置得很难完成,Astra 也没有尝试绕开 Auto-review。
在“对自己的能力做出不实陈述”这项测试里,Astra 的错误概率约为 Sol 的三分之一。
但 OpenAI 也承认了一个不太好处理的问题。
当测试明确要求模型规避监控时,Astra 写出来的推理过程反而比 Sol 更难监控。原因是它在简单任务中可以用更少的步骤完成工作,留下的文字轨迹也更短。
复杂任务里,它还会留下更多线索。OpenAI 表示,这个问题正在继续处理。
实际使用时,ChatGPT 和 Codex 会有分类器实时检查模型的推理和操作。系统发现风险后,任务可能暂停并要求用户确认;API 任务则可能直接停止。
这套机制也会误伤正常工作,尤其是合法的防御性安全任务。OpenAI 目前还在调整。
数学和科学成绩很高,但综合榜单并不全赢
Astra 在质数间隙问题上给出了两个新结果。
一个结果把相邻质数之间的上界从 246 推进到 186。另一个结果改进了一个已经八十多年没有变化的质数大间隙界限。相关证明和精简版思维链已经公开。
基准成绩中,Astra 在 FrontierMath Tier 4 上是 97.6%,正文四舍五入写成 98%;GPQA Diamond 是 96.0%,ARC-AGI-3 是 99.9%。
但在 Humanity’s Last Exam 的工具测试中,Astra 得分 57.2%,低于 Claude Fable 5.1 的 65.0%。Artificial Analysis 综合智能指数里,Astra 是 61.2,也低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1。
这组结果看起来更接近真实情况:Astra 在电脑操作、终端编程和部分数学科学任务上有明显提升,但“所有方面都是第一”并不是完整表格呈现出来的结论。
我的判断
GPT-6 Astra 的变化,主要发生在模型和电脑之间。
它不再满足于告诉你“应该怎么做”,而是开始自己打开软件、填写内容、运行代码,再根据结果继续往下走。
这会让很多工作少掉一批复制、粘贴和切窗口的动作。与此同时,权限、监控、错误恢复和成本也会变得更重要。
价格方面,API 输入每百万 Token 10 美元,输出 50 美元,Fast 模式还要翻倍。它适合处理值得交给 Agent 长时间推进的工作,不适合把每个小问题都丢进去跑。
能力方面,电脑操作是最值得关注的部分;编程能力有提升,但没有在所有基准上碾压其他模型;网络安全能力则因为太强,反而会带来更严格的使用限制。
GPT-6 Astra 是否已经到了 AGI,Greg Brockman 的判断可以留给时间验证。现在能确认的是,模型正在从“回答问题”走向“操作电脑完成任务”。
项目与发布信息:
- OpenAI 官方页面:https://openai.com/index/gpt-6-astra/
- ChatGPT:https://chatgpt.com/