GPT-6 Astra发布:从会回答到直接交付工作

GPT-6 Astra已正式发布,但尚未向所有用户开放。它的核心变化不是单纯提升聊天和跑分,而是能够操作电脑、调用专业软件、执行多步骤任务并交付结果。本文梳理其能力、测试、成本与安全边界,并讨论“AGI时代”是否已有充分事实依据。

GPT-6 Astra发布:从回答问题到直接交付工作

2026年9月3日,GPT-6 Astra正式发布。

但“发布”不等于所有人现在就能用。现阶段,Astra首先面向 Daybreak Access 计划中的机构、可信防御者和少数合作企业开放,之后再逐步覆盖 Plus、Pro、Business 和 Enterprise 用户。产品还将进入 OpenAI API 和 AWS 云平台,免费版暂时不可用,Plus 用户也需要等待后续开放。

这次发布最值得看的地方,不是某个榜单上的数字又涨了多少,而是产品形态发生了变化:过去的模型通常告诉你应该怎么做,Astra试图替你打开软件、点击按钮、填写表格、运行代码,再把结果整理出来。

换句话说,它从“回答问题”正式推到了“直接交付工作”。

OpenAI总裁 Greg Brockman 在发布会结尾说:“欢迎来到AGI时代。”这句话很有冲击力,但判断Astra是否真的进入AGI时代,不能只看发布会口号。更实际的问题是:它能否在真实环境中稳定完成跨软件、多步骤、有权限边界的任务?

发布状态:Astra不会一夜之间向所有用户开放

从现有披露看,Astra采用的是分阶段开放,而不是一次性全面上线。

项目 当前披露信息
发布状态 素材称已于2026年9月3日正式发布
首批用户 Daybreak Access 计划中的机构、可信防御者和少数企业
后续用户 Plus、Pro、Business、Enterprise
平台 OpenAI API、AWS 云平台
免费版 暂时不可用
开放方式 分阶段推进,不能视为已对所有用户开放

这种安排和它的能力范围有关。Astra不只是生成文字,它可以操作浏览器、办公软件、开发工具和部分专业应用。当模型拥有更多电脑权限后,系统需要处理的不再只是“回答错了怎么办”,还包括它能访问哪些文件、能否提交表单、能否修改业务数据,以及在什么情况下必须停止。

因此,Daybreak Access 并不只是营销名称。至少从素材披露的安全安排看,OpenAI希望先让一部分机构测试权限、监控和防滥用机制,再扩大使用范围。

这也意味着,普通用户短期内可能只能看到演示和基准成绩,未必能立即把Astra接入自己的工作流。

Computer Use:从给出步骤到替用户执行

Astra的主线能力是 Computer Use,也就是直接使用电脑。

传统聊天模型遇到“帮我整理客户资料并更新CRM”时,通常会输出操作步骤,或者生成一段脚本。接下来仍然需要人打开CRM,找到对应客户,复制字段,检查内容,再点击保存。

Astra的设计目标则是接受一个任务目标,自己完成后续动作。素材中提到的能力包括:

  • 操作鼠标和键盘;
  • 打开浏览器并浏览网页;
  • 填写在线表单;
  • 更新CRM记录;
  • 安排日历;
  • 搜索资料;
  • 将结果整理成邮件、文档或报告。

这类任务的难点不在于单次点击,而在于连续操作时不能丢失目标。比如,预约一个医生可能需要先搜索机构,再查看地图和评价,确认科室和时间,填写患者信息,最后处理预约页面。每一步都不算特别复杂,但中间任何一次误判,都可能导致预约错人、错地点,或者把不完整的信息提交出去。

OSWorld 2.0 的测试结果被多份素材提及。Astra得分为72.6%,界面定位得分为92.7%,任务耗时减少47%。另一段转录把具体耗时说成从75分钟降至40分钟。两种说法表达的方向一致,但不能把它们当成完全独立、口径一致的数据。

测试或指标 GPT-6 Astra素材披露结果 需要注意的地方
OSWorld 2.0 72.6% 测试版本和对比模型需区分
界面定位 92.7% 反映识别界面元素的能力
任务耗时 减少47% 另有素材称从75分钟降至40分钟
Web任务 新版Codex达到上一代1.9倍 具体任务口径仍需看测试说明

这个变化对企业更重要。企业未必关心模型能否写出一段漂亮的解释,但会关心一项任务需要多少人工介入,失败后能不能恢复,最终结果是否能直接进入业务流程。

从W2税表到Power BI,交付的是一整段工作流

发布演示中出现了多个办公场景。

在税务文档案例里,Astra根据一张 W2 税表,起草或填写完整的联邦税申报材料,涉及 1040 相关内容。这个演示说明模型能够读取文件、识别字段,再把信息放入另一套结构化文档中。

但它不能被理解为“模型可以替代税务专业人士”。税表中的数字、身份信息、抵扣项目和申报责任都需要复核。演示证明的是自动处理流程的能力,不是税务意见的法律效力。

办公自动化案例也遵循相同的逻辑:更新CRM、整理日历、填写表格,然后生成邮件或文档。模型需要在不同页面之间切换,还要保持字段之间的对应关系。

Power BI案例更能体现跨软件执行。素材称,Astra先导入车辆数据,再完成数据分析、制作图表,并生成报告。它做的事情已经超过“请帮我解释这份数据”,而是把数据处理、可视化和文字交付串成了一条流程。

Excel财务建模演示也类似。Astra完成了公式、表格和答案,素材称其在“财务建模世界杯”的实战题上刷新了前沿结果。无论这一表述最终如何核验,至少可以看出,评价模型的方式正在改变:人们开始看它能不能把一个空白工作表变成可检查的结果,而不只是能不能告诉你公式怎么写。

这类任务的共同点可以概括为四步:

  1. 读取自然语言、表格或文件;
  2. 理解专业软件中的结构;
  3. 在界面或工具中执行操作;
  4. 输出可以继续使用的结果。

任何一步出错,整项任务都可能需要人工返工。所以,Astra真正的企业价值不能只看Token单价或单轮回答准确率,还要看它完成一项任务时需要多少次重试,以及最后有多少内容要由人重新检查。

KiCad、Blender和Unity:模型进入专业软件

Astra的演示没有停留在浏览器和办公软件。

在 KiCad 案例中,模型根据电子原理图完成PCB布局,包括元件摆放和走线。素材曾用“可以直接送厂”来形容结果,这属于较强的体验性判断。更稳妥的说法是,演示结果已接近可以进入后续生产流程,但是否符合实际制造要求,仍需要工程师检查电气规则、元件封装、信号完整性和生产约束。

CAD相关测试中,Astra得分为95.9%,素材给出的对比数据是 Fable 5.1 为84.3%,Soul为83.3%。这些成绩显示,它在某些结构化设计任务上表现突出,但测试成绩不等于一份经过工程审签的设计文件。

三维场景演示则把多个软件连接起来。Astra先在 Blender 中建造房屋,再导入 Unreal Engine 4,形成可以步行查看的场景。设计师或客户可以提前观察空间、光影和动线,发现布局问题后再修改。

另一个演示是制作齿轮和轴同步运转的变速箱动画,涉及工程设计、渲染和动画。素材还称,Unity可以通过一句提示词生成接近实时走查的3D游戏。

这些案例的共同点不是“AI会生成模型”,而是模型开始尝试完成专业软件中的一段连续操作。它需要理解对象之间的关系,调用合适的工具,并根据界面反馈调整下一步动作。

新版 Codex 也被纳入这条产品线。素材称,接入新版Codex后,Web任务完成速度达到上一代的1.9倍。速度提升对开发者有吸引力,但仍要看任务是否完成、代码是否可维护,以及生成结果能否通过测试。

Unreal Engine中的“AI居民”演示尤其容易引发想象:虚拟世界里的居民彼此对话、采取行动,像是在自主生活。不过素材同时明确指出,Demo本身还不稳定。这个限定不能删掉。演示展示了可能性,却没有证明它已经成为可靠的生产系统。

生活服务任务:难点在于持续执行,而不是单步搜索

Astra的生活场景演示更容易让普通用户产生代入感。

它可以寻找儿科医生,查看地图和评价,再查询预约信息;可以比较公寓的户型、租金和租期;可以预约DMV,核对所需材料、寻找网点并安排时间;还可以制作低碳水食品清单,查询成分、比较价格并下单。

另外一个案例是分析幼儿园、学区、通勤和口碑。这里的任务并非单纯搜索某个关键词,而是把多个条件放在一起进行比较。

这种智能体任务最关键的能力,不是每一步都做得惊天动地,而是能否记住最初的要求。用户说“只考虑某个通勤范围内、租期符合要求的公寓”,模型就不应该在看到一个便宜房源后擅自放宽条件。

视频作者对Astra有几个体验性评价:“很守规矩”“从来不越权”“能做什么、不能做什么,说得很诚实”“不中途改需求”。这些话可以帮助我们理解演示中的使用感受,但它们仍然是对具体演示的观察,不是对所有任务的安全保证。

真正投入使用时,模型还会遇到更多边界:网页结构变化、登录失效、验证码、信息缺失、收费确认、用户授权,以及不同网站之间互相矛盾的数据。一个智能体能不能在这些情况下停下来问人,而不是自作主张继续执行,往往比它能否完成顺利流程更重要。

跑分很强,但没有证明综合能力全面第一

Astra在多个专项测试中取得了很高成绩。不同素材的数字存在差异,尤其是 ARC-AGI-3。

测试项目 素材披露结果 说明
ARC-AGI-3 98.6%或99.9% 不同素材数值冲突,且可能包含Agent系统贡献
FrontierMath Tier 4 97.6% 数学推理专项
Exploit Bench 100% 网络安全相关测试
二进制逆向 88% 专项能力测试
CAD相关测试 95.9% 专业设计任务
GPQA 96% 素材称排名第一
OSWorld 2.0 72.6% 电脑操作测试
Terminal Bench Science 64.6% 科研工具和终端任务

ARC-AGI-3的两种说法分别是98.6%和99.9%。素材还称,这个成绩是在 Responses API 框架下取得,模型与Agent系统共同参与评分。因此,不能把成绩无条件归因于模型本体,也不能把抽象推理测试直接等同于通用智能已经被完整证明。

软件工程成绩也没有呈现“所有项目都碾压”的局面。Terminal Bench 4.0 的转录结果约为57.7%至57.9%,Soul为37.3%,Fable 5.1为55.8%。DeepSWE 1.1的结果则是74.1%或74.8%。素材称,同档模型在这一测试上大约处于73%至74%,Astra很强,但并非绝对领先。

综合智能指数的数据更直接:

模型 AA综合智能指数
GPT-6 Astra 61.2
Fable 5.1 65.7
Opus 5 63.1

“人类最后考试”中,Astra为57.2%,素材另称Fable 5.1约为65%。这组数字至少说明一件事:Astra在特定复杂任务、科研工具和电脑操作上出现了明显跃升,但专项最强,不等于综合指数全胜。

如果只挑 ARC-AGI-3、FrontierMath 和网络安全测试,Astra看起来几乎无所不能;把综合指数、软件工程和测试口径一起放进来,结论就会更克制,也更接近事实。

科研能力:从查资料走向搭建处理流程

科研演示是Astra较有辨识度的一部分。

素材称,它能够在显微图像处理中搭建细胞追踪流程,把图像转化为轨迹和谱系记录。这类任务通常需要处理图像、编写或调用分析程序,再检查中间结果是否合理。模型如果只能给出代码片段,研究人员仍然需要自己配置环境、运行程序和整理输出;如果它能够直接在科研工具中完成这些步骤,工作方式就会发生变化。

Terminal Bench Science 中,Astra得分为64.6%,素材给出的对比数据是 Soul 22.4%,Fable 5.1 为52.6%。GPQA成绩则被称为96%。

还有一项更容易被过度解读的数学案例。素材称,Astra把素数间隙的界从240推到186。这个表述可以作为演示或素材声称保留,但不能直接写成学界已经接受的原创科学突破,更不能跳过证明过程、同行评议和可复现性。

如果这些结果能在独立、可复现的环境中稳定取得,Astra的科研价值就不只是帮助研究人员查论文或解释概念,而是可以在专业软件里搭建流程、处理数据,产出可供人复核的中间结果。科研工作不会因此变成无人监督的自动生产线,但模型参与的位置会更靠近实际操作。

Critical安全等级:它能做什么,决定了为什么要分级开放

Astra发布中最重要的安全信号之一,是素材称它达到OpenAI防范准备框架最高级别的 Critical 网络安全等级。

在素材的解释中,达到这一等级意味着模型不需要人类逐步指导,就能自主发现漏洞、串联利用过程,并形成攻击链。内部测试还发现了两个 V8 引擎零日漏洞。

这类能力和普通代码补全不是同一个风险等级。一个模型写错函数,通常需要开发者发现;一个模型能够定位漏洞并自动组织攻击步骤,风险会随着访问权限、联网能力和执行工具一起放大。

因此,OpenAI设置了 Daybreak 计划,把相关高风险能力先面向可信防御者开放。标准接口会拒绝漏洞利用类请求。配套监控系统则会实时检查模型的推理和行动,一旦发现未经授权的活动,就暂停任务。

安全控制也会带来使用成本。合法任务可能被减速、暂停或拦截,API中被标记的任务甚至可能直接停止。素材还提到,Astra可以用更少的自然语言推理Token处理更复杂的问题,这使人类更难仅靠文字化思考过程判断模型究竟在做什么。

风险变化可以这样理解:

过去主要担心“模型会不会答错”;现在还要关注“模型能操作什么、能访问什么、什么时候必须停下来”。

这也是Astra没有一次性对所有人开放的重要原因之一。模型能力越接近执行系统,权限设计和实时监控就越不能靠事后补救。

Token价格上涨,任务总成本未必同步上涨

Astra的API价格明显更高。

  • 输入:每百万Token 10美元;
  • 输出:每百万Token 50美元;
  • 缓存:每百万Token 1美元;
  • 输入超过27.2万Token后,触发阶梯计价;
  • Fast模式价格翻倍。

关于Fast模式的速度,素材中有“速度翻倍”和“快2.5倍”两种说法,不能强行合并。整体价格则被称为约为上一代 GPT-5.6 的2.5倍。

单看价格,Astra并不便宜。但OpenAI强调,企业不应只比较每百万Token的价格。如果便宜模型需要反复尝试,最后还要人工修正,那么单项任务的总成本可能更高。

素材给出的任务成本比较包括:

  • 在 Terminal Bench Science 上,比 Fable 5.1 低31%;
  • 在另一项被转录为“BenchGate”的测试上低86%,但测试名称需要进一步核验;
  • 在最高推理努力下,单项任务成本与 GPT-5.6 基本持平;
  • 低于某个被转录为“Cloud Fable”的对手模型一半。

这些数字同样需要结合测试条件理解,不能直接当成所有企业场景都成立的报价结论。企业真正需要测量的是:

采购问题 需要观察的指标
一项任务要花多少钱 输入、输出、缓存和重试Token
模型是否真的省人 人工复核时间和返工时间
自动化是否稳定 成功率、失败率、恢复率
权限是否可控 可访问系统、文件和操作范围
规模化后是否划算 并发、延迟、监控和中断成本

如果Astra能一次完成过去需要多人配合的流程,较高的Token价格可能仍有商业意义;如果它在关键步骤频繁停顿,人工不得不逐项检查,价格优势就可能消失。

“欢迎来到AGI时代”,还需要真实工作结果来验证

Greg Brockman说“欢迎来到AGI时代”,素材还称他将Astra描述为“全球最聪明、最听话的模型”,并认为这是一次能力的代际飞跃。Epoch AI评测负责人 Greg Burnham 也被转述为认为,这标志着一个时代结束、另一个时代开始。

这些表述代表OpenAI及相关视频对产品的定位,不能写成行业已经普遍承认 GPT-6 Astra 是 AGI。

判断它是否接近这个目标,至少要看三个问题。

第一,它能否完成跨软件、多步骤、带外部反馈的任务。OSWorld 2.0 的72.6%、办公自动化、KiCad、Power BI、Blender和生活服务演示,说明它确实在朝这个方向推进。

第二,它能否在科研、工程和复杂推理中稳定地产出可复核结果。ARC-AGI-3、FrontierMath、GPQA和Terminal Bench Science的高分提供了支持,但ARC-AGI-3可能包含Agent系统贡献,科研和数学案例也仍然需要复现与专业审核。

第三,它能否在权限、安全和监控框架下可靠运行。Critical级网络安全能力说明模型的上限更高,却也说明它必须接受更严格的控制。一个任务能完成,不代表它应该拥有无限权限;一个模型很聪明,也不代表它总能判断什么时候必须停下来。

因此,Astra当前最稳妥的判断是:它把AI产品的评价重点推向了“能否在真实环境中独立完成并交付工作”。这比单纯提高聊天质量更接近企业自动化和专业工具的实际需求。

但它是不是AGI,不会由一句发布会口号决定。接下来更值得观察的,是它在开放后的任务稳定性、错误恢复、权限控制、人工复核比例和实际成本。专项测试可以说明模型在哪些地方很强,真正的产品能力则要看它能否在复杂、混乱、充满例外的现实工作流里,持续给出可检查、可控制、愿意在必要时停下来的结果。