← 返回全部文章

GPT-6 Astra 来了,Greg 说“欢迎来到 AGI 时代”

OpenAI 发布 GPT-6 Astra,主打电脑操作、长流程任务和软件工程。它可以自己操作网页和桌面软件,价格与 Claude Fable 5.1 接近,但目前仍处于分批开放阶段,部分能力也会受到安全限制。

OpenAI 今天发布 GPT-6 Astra。

发布前的媒体沟通会上,OpenAI 总裁 Greg Brockman 说,他个人认为 OpenAI 已经做到了 AGI。以后回头看,人们可能会把 GPT-6 Astra 当成那个节点。

这句话很大,先放在这里。真正和普通用户有关的,是两个问题:

它什么时候能用?

多少钱?

什么时候能用,价格怎么算

GPT-6 Astra 首批只面向 OpenAI 网络安全项目 Daybreak 的少数机构。

接下来几天,它会逐步推送给 ChatGPT Plus、Pro、Business 和 Enterprise 用户,同时开放 API,并接入 AWS Bedrock。

企业版默认不会自动启用,需要管理员手动打开。

订阅用户的使用量包含在现有额度里。额度用完之后,可以额外购买积分。

API 模型名是 gpt-6-astra,价格如下:

  • 输入:每百万 Token 10 美元
  • 输出:每百万 Token 50 美元
  • Fast 模式:速度最高提升 2.5 倍,价格翻倍

这个价格和 Anthropic 的 Claude Fable 5.1 一样。相比 GPT-5.6 Sol 的促销价,Astra 大约贵了 2.5 倍。

所以它暂时不是一款“随便开着玩”的便宜模型。尤其是让它长时间操作电脑、跑代码或处理多步骤任务时,输出 Token 和运行时间都会直接变成成本。

Astra 最主要的能力,是替你操作电脑

Astra 这次主打的是 computer use。

简单说,模型可以看屏幕、点鼠标、输入文字、切换软件,然后把多个步骤连起来完成。

OpenAI 给出的场景包括:

  • 填写网页表单
  • 更新 CRM 客户记录
  • 整理日历
  • 在邮件或文档编辑器里写研究摘要
  • 分析科学数据并绘图
  • 创建网站并运行前端测试
  • 安装软件并排查报错
  • 在 KiCad 里做 PCB 电路板布线
  • 在 Blender 里建房子模型,再导入 Unreal Engine 5 做成可行走场景

以前让模型做这些事,通常要靠人来回切窗口。模型给出代码,人复制到编辑器里;模型写出摘要,人再粘到文档中;网页需要填表,还得一个字段一个字段地传给它。

Astra 试图把中间这些动作接过去。

它可以先理解你的目标,再自己在电脑上推进任务。比如制作一份 PPT,它可以读取材料,进入演示文稿工具,沿用现有模板,安排页面和文字,之后根据修改意见继续调整。

OpenAI 还特别强调,Astra 更擅长按照模板制作 PPT。它会尽量保持公司原有的排版和语气,也会少塞一些与任务无关的内容。

这类能力对日常办公可能比单纯的聊天问答更有用。你不需要只拿到一份建议,还能得到一个已经填好、改好或跑过测试的结果。

但权限不能给得太大。

付款、发邮件、提交表单、删除文件、改生产系统数据,这些操作都应该保留确认环节。电脑操作 Agent 一旦点错,影响范围也会比普通聊天更直接。

编程能力提升明显,但不是所有测试都第一

OpenAI 称 GPT-6 Astra 是它目前最好的软件工程模型。

在 Terminal-Bench 4.0 上,Astra 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 是 37.3%。

OpenAI 还说,Astra 在单任务 API 成本上比 Fable 5.1 低约 63%。

不过,完整成绩表并不是 Astra 全面领先。

在 DeepSWE v1.1 上,Astra 是 74.1%,Claude Opus 5 是 73.7%,两者很接近。

FrontierCode 1.1 的两项测试里,Claude Fable 5 都略高于 Astra。Artificial Analysis 的编程智能体指数中,Astra 得分 67.0,也低于 Opus 5 的 68.1。

所以更准确的说法是:Astra 在不少编程测试中领先,尤其是终端操作和长流程开发任务,但没有把其他模型全部甩开。

Jane Street 的 John Crepezzi 评价说,Astra 生成的代码需要较少迭代就能达到上线质量,开发者也更容易跟上它的沟通过程。

Codex 还有一个挺实用的变化。

以前长会话的上下文用满后,模型只能把之前的过程压缩成摘要。压缩几次之后,某个修复为什么失败、试过哪些方案,很容易丢掉。

Astra 可以跨上下文窗口记笔记,旧的上下文窗口也能搜索。这个功能目前还需要在 config.toml 里手动打开,之后几周会逐步变成默认配置。

网络安全能力很强,普通用户反而会被限制

Astra 达到了 OpenAI Preparedness Framework 中的网络安全 Critical 阈值。

OpenAI 对这个等级的描述是,模型已经有能力在没有人逐步指导的情况下,寻找并利用未知漏洞,攻击防护较严密的系统。

在 ExploitBench 测试中,Astra 把已知漏洞转化为可用攻击代码的成功率是 100%,GPT-5.6 Sol 是 78.5%。

OpenAI 还用今年 6 月到 8 月出现的 20 个 Chrome V8 高危漏洞做了新测试,尽量排除模型只是“背过题”的可能。Astra 成功率 39%,Sol 是 5.5%。

测试期间,Astra 还发现并利用了两个此前没有公开的零日漏洞。OpenAI 表示,相关问题已经通报给维护方。

这也是为什么普通用户拿到的版本不会完全开放这类能力。对于编写漏洞利用概念验证代码之类的请求,模型会直接拒绝。正常开放的方向主要是代码审查、修复漏洞和安全加固。

更宽松的版本会先通过 Daybreak 项目申请,之后再逐步开放给漏洞验证、恶意软件分析和检测规则编写等防御性工作。

对齐表现更好,但监控也变得更难

OpenAI 把“不越权、不绕过安全检查”列为 Astra 的另一项重点。

在一项测试里,模型被要求完成一个困难甚至可能无法完成的任务。去掉生产环境安全措施后,GPT-5.6 Sol 有 48% 的概率越过授权目标,Astra 是 0%。

Codex 的 Auto-review 拒绝某个操作后,OpenAI 又测试 Astra 会不会想办法绕过限制。即使测试故意把任务设置得很难完成,Astra 也没有尝试绕开 Auto-review。

在“对自己的能力做出不实陈述”这项测试里,Astra 的错误概率约为 Sol 的三分之一。

但 OpenAI 也承认了一个不太好处理的问题。

当测试明确要求模型规避监控时,Astra 写出来的推理过程反而比 Sol 更难监控。原因是它在简单任务中可以用更少的步骤完成工作,留下的文字轨迹也更短。

复杂任务里,它还会留下更多线索。OpenAI 表示,这个问题正在继续处理。

实际使用时,ChatGPT 和 Codex 会有分类器实时检查模型的推理和操作。系统发现风险后,任务可能暂停并要求用户确认;API 任务则可能直接停止。

这套机制也会误伤正常工作,尤其是合法的防御性安全任务。OpenAI 目前还在调整。

数学和科学成绩很高,但综合榜单并不全赢

Astra 在质数间隙问题上给出了两个新结果。

一个结果把相邻质数之间的上界从 246 推进到 186。另一个结果改进了一个已经八十多年没有变化的质数大间隙界限。相关证明和精简版思维链已经公开。

基准成绩中,Astra 在 FrontierMath Tier 4 上是 97.6%,正文四舍五入写成 98%;GPQA Diamond 是 96.0%,ARC-AGI-3 是 99.9%。

但在 Humanity’s Last Exam 的工具测试中,Astra 得分 57.2%,低于 Claude Fable 5.1 的 65.0%。Artificial Analysis 综合智能指数里,Astra 是 61.2,也低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1。

这组结果看起来更接近真实情况:Astra 在电脑操作、终端编程和部分数学科学任务上有明显提升,但“所有方面都是第一”并不是完整表格呈现出来的结论。

我的判断

GPT-6 Astra 的变化,主要发生在模型和电脑之间。

它不再满足于告诉你“应该怎么做”,而是开始自己打开软件、填写内容、运行代码,再根据结果继续往下走。

这会让很多工作少掉一批复制、粘贴和切窗口的动作。与此同时,权限、监控、错误恢复和成本也会变得更重要。

价格方面,API 输入每百万 Token 10 美元,输出 50 美元,Fast 模式还要翻倍。它适合处理值得交给 Agent 长时间推进的工作,不适合把每个小问题都丢进去跑。

能力方面,电脑操作是最值得关注的部分;编程能力有提升,但没有在所有基准上碾压其他模型;网络安全能力则因为太强,反而会带来更严格的使用限制。

GPT-6 Astra 是否已经到了 AGI,Greg Brockman 的判断可以留给时间验证。现在能确认的是,模型正在从“回答问题”走向“操作电脑完成任务”。

项目与发布信息: