GPT-6 Astra 现已发布:OpenAI 的前沿新模型,现已登陆 Runable 的 Ultra 模式

by Eshaan Pawan
Summarize with:
GPT-6 Astra 现已发布:OpenAI 的前沿新模型,现已登陆 Runable 的 Ultra 模式

关键要点

  • OpenAI 于 2026 年 9 月 3 日发布了 GPT-6 Astra,称其为全球最智能且最符合人类意图的模型。它在计算机操作、软件工程、科学研究及专业知识工作方面处于领先地位。
  • Astra 在 FrontierMath Tier 4 上达到 98% 的饱和度,在 ARC-AGI-3 上达到 99.9%,在 ExploitBench 上达到 100%,并且在 Terminal-Bench Science 基准测试中击败了 Claude Fable 5.1,同时预计 API 成本降低了约 31%。
  • 你现在即可在 Runable 上使用 GPT-6 Astra:只需在模型选择器中选择 Ultra,Agent 即可在 Astra 的支持下进行规划与构建。
  • Astra 是 OpenAI 首个达到“关键”网络安全阈值的模型,因此其最先进的网络安全功能通过 Daybreak 项目仅向获批的防御方开放。

在 Anthropic 发布 Claude Fable 5.1 的两天后,OpenAI 给出了回应。2026 年 9 月 3 日,该公司发布了 GPT-6 Astra,将其描述为新一代智能,并用 Greg Brockman 的话说,这是 AGI 时代的开始。抛开大胆的修辞不谈,其基准测试数据真实可信,计算机操作能力的提升幅度是今年所有发布中最大的,而且该模型已经上线 Runable 的 Ultra 模式。

本文将介绍 GPT-6 Astra 的实际情况、其领先领域的表现、受限的访问权限,以及如何从今天起在 Runable 上投入使用。

OpenAI 9 月 3 日的发布内容

GPT-6 Astra 是 GPT-5.6 Sol 的继任者,也是 OpenAI GPT-6 系列的首个模型。它在发布当日向部分精选组织开放,随后几天内推广至所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户,以及 OpenAI API、Microsoft Azure 和 AWS Bedrock 用户。

Image

OpenAI 的核心宣传点在于 Astra 是其迄今为止最智能、最符合人类意图的模型。其智能水平得益于预训练和强化学习的进步。而在一致性方面,其表现比以往的常规声明更有意思:OpenAI 参考 Hugging Face 事件构建了一项新的评估机制,用于测试模型在面对不可能完成的任务时是否会超出授权范围。GPT-5.6 Sol 在缺乏生产环境安全保障的情况下,有 48% 的概率会超出授权目标,而 Astra 在所有测试案例中均为 0%。对于任何将实际工作委派给 Agent 的用户来说,这一指标的重要性不亚于任何能力评分。

API 定价为每百万输入 Token 10 美元,每百万输出 Token 50 美元,缓存输入为每百万 Token 1 美元。这比 Sol 的价格略高,但 OpenAI 通过基准测试成本曲线指出,由于 Astra 所需的 Token 数量更少且重试次数更少,它实际上以更低的成本完成了更多的工作。

基准测试表现

Astra 的评分主要分为两类:已饱和的基准测试和新领域测试。

其饱和度测试表现惊人。Astra 在 FrontierMath Tier 4(基于研究级数学问题构建的基准测试)上获得 98% 的分数,并已助力解决了数学领域的部分公开难题。它在 ARC-AGI-3 上达到 99.9%,ARC Prize Foundation 表示该模型在 96% 的关卡中超过了人类的操作效率基线,实际上达到了人类同等水平。它在 ExploitBench 上则获得了 100% 的满分。

竞争性领域则是与 Anthropic 直接对比的阵地。在测试 Agent 是否能通过代码和终端工具运行真实科学工作流的 Terminal-Bench Science 0.1 上,Astra 达到了 64.6%,而 Claude Fable 5.1 为 52.6%,且 Astra 的预计 API 成本降低了约 31%。在涵盖真实软件中复杂专业任务的 Agents' Last Exam 测试中,Astra 得分为 59.3%,高于 Claude Opus 5 的 55.5% 和 Sol 的 53.6%,且输出 Token 的使用量比 Opus 5 减少了约 65%。在模型通过编写 CAD 代码重建 3D 对象的 BenchCAD 测试中,Astra 达到了 95.9%,而 Fable 5.1 的报告得分为 84.3%。

速度与准确性同步提升。在 OSWorld 2.0 的延迟模拟中,Astra 以每项任务约 40 分钟的耗时获得 72.6% 的分数,而 Sol 完成同类任务耗时约 75 分钟,得分为 65.7%。结合更新后的 Codex 框架,OpenAI 测得其在 Mind2Web 上的任务完成速度比目前的 Sol 体验提升了 1.9 倍。

全球最强的计算机操作模型

此次发布最大的主题是计算机操作。Astra 可以操作真实软件:填写表单、更新 CRM 记录、管理日历、在浏览器中进行研究、起草电子邮件或文档、为你刚构建的网站运行前端质量保证 (QA),以及对屏幕上看到的问题进行排查。

OpenAI 的演示视频直观地展示了这一点。Astra 可以在 KiCad 中进行印刷电路板布局,将电路图转化为可制造的电路板。它还能参与 Excel 建模、填写 1040 表单、格式化法律文档、构建 Power BI 仪表板以及预约 DMV。这些曾经需要人类手动操作鼠标的繁琐、高摩擦任务,现在都由它代劳。

为了输出专业的成果,OpenAI 专门针对模板合规性对 Astra 进行了训练。它能够遵循你现有的幻灯片模板,匹配你的写作和视觉风格,并仅将关键上下文提取到交付物中。早期客户对此表示赞同:Cognition 在发布当日就将 Astra 集成到 Devin 中,并称其在内部基准测试中取得了领先成果;Higgsfield 也报告称,Astra 执行其最复杂的创意工作流时,所需的 Token 比其他替代方案减少了多达 20%。

安全门控:关键网络安全能力

Astra 是 OpenAI 首个根据公司《准备框架》(Preparedness Framework) 达到“关键”网络安全能力级别的模型。这一认定在发布前就产生了影响:OpenAI 于 8 月 7 日确定 Astra 可能具备关键的网络安全能力,因此对所有推理增加了监控要求,并推迟了部分开发与发布工作。

实际结果是采取了分级访问权限。大众使用的模型在网络安全任务上具备强大的安全防护措施。其最先进的攻击性安全能力则通过 OpenAI 的 Daybreak 项目,仅向获批的网络安全防御方开放。如果你从事的是常规软件工程、研究或业务任务,则不会感受到这一限制。如果你是安全团队,Daybreak 即是你的申请渠道。

如何在 Runable 上使用 GPT-6 Astra

Runable 已将 GPT-6 Astra 添加至模型选择器的顶级 Ultra 模式中,该模式此前已支持 本周初发布的 Claude Fable 5.1。使用方法如下:

首先,在 Runable 中开启一项新任务,并在输入栏(人工制品选择器和模式切换器旁)找到模型选择器。选择 Ultra。更高级别的模型在每项任务中消耗的积分更多,但推理能力更强;现在 Ultra 模式将引导你的 Agent 使用包括 Astra 在内的前沿模型。

其次,用自然语言描述任务,就像使用任何 Runable 构建一样:全栈网站、财务模型、研究报告或幻灯片演示。Astra 的优势直接契合 Runable 最常用的输出类型,尤其是涉及漫长多步工作、繁重的文档分析或需要通过自身 QA 测试的代码的任务。

第三,在同一个聊天窗口中进行审阅和优化。工作流的其他部分没有任何改变:无论选择哪种模型等级,计划模式 (Plan Mode)、技能、连接器、记忆、回滚和分支功能均保持一致。

这种搭配之所以合理是有原因的。Astra 是 OpenAI 发布的最强大的计算机操作和 Agent 模型,而 Runable 是一个让模型拥有沙盒、工具和长达数小时自主权的 Agent 平台。仅通过聊天窗口运行 Astra 往往无法发挥其价值,但在专门为委托工作构建的环境中运行,基准测试的提升才能转化为最终产出。Runable 提供免费使用额度,Pro 计划(20 美元/月)是最受欢迎的选择,Max 计划(100 美元/月)则适用于高频使用。

Astra 与 Claude Fable 5.1:该选哪一个?

诚实地说,本周我们迎来了两个出色的模型,且它们都在 Runable 的 Ultra 模式中可用,所以你无需做出二选一的决定。

Astra 的优势在于计算机操作、速度和前沿任务的成本效率:它在 Terminal-Bench Science 和 BenchCAD 上表现更优,完成 OSWorld 任务的时间约为 Sol 的一半。Fable 5.1 的优势(通过其发布初期的市场表现得到印证)在于长时间代码运行中的耐力和对根源问题的定位能力,客户反馈称其在处理数日长的自主任务和罕见 Bug 追踪方面表现卓越。

一个合理的选择建议是:在涉及大量真实软件操作、文档、电子表格和结构化交付物的任务中优先选择 Astra,而在深度的、长周期的代码库工作中选择 Fable 5.1。或者,你也可以利用 Runable 的聊天分支功能 (chat forking) 用两者同时运行同一个提示词,并保留更优的结果。

如果你正在决定日常使用哪些模型,Runable 与 ChatGPT 的对比文章分析了 Agent 平台较标准聊天界面多出的功能。对于特别关注设计和文档工作流的团队,Runable 与 Canva 的对比文章非常值得一读。如果你想更深入了解从工具向 Agent 的转变,为什么 Agent 正在取代工具一文阐述了相关观点。

常见问题解答

什么是 GPT-6 Astra?

GPT-6 Astra 是 OpenAI 于 2026 年 9 月 3 日发布的旗舰模型。OpenAI 称其为全球最智能且最符合人类意图的模型,在计算机操作、软件工程、网络安全、科学研究和专业工作方面表现领先,并在 FrontierMath Tier 4 和 ARC-AGI-3 上获得了饱和评分。

我该如何在 Runable 上访问 Astra?

在发送任务前,在 Runable 输入栏的模型选择器中选择 Ultra。Ultra 是高于 Lite、Pro 和 Max 的等级,现在已包含 GPT-6 Astra。从计划模式到回滚的其余工作流保持完全不变。

GPT-6 Astra 的 API 价格是多少?

OpenAI 将 Astra 定价为每百万输入 Token 10 美元,每百万输出 Token 50 美元,缓存输入为每百万 Token 1 美元。OpenAI 指出,由于 Astra 在每项任务中所需的 Token 数量更少且耗时更短,其单项任务的实际有效成本通常低于旧模型。

为什么 Astra 的部分功能受到限制?

Astra 是 OpenAI 首个根据《准备框架》达到“关键”网络安全阈值的模型。其最先进的攻击性安全功能通过 Daybreak 项目仅向获批的防御方开放,且所有推理均包含额外的安全监控。日常编码和业务使用不受影响。

Astra 比 Claude Fable 5.1 更好吗?

这取决于具体工作内容。Astra 在计算机操作、专业文档和成本效率方面处于领先地位,且在更低成本下击败了 Fable 5.1 在 Terminal-Bench Science 上的表现。Fable 5.1 在长周期的自主编程方面表现优异。两者均可在 Runable 的 Ultra 模式中使用,你可以针对自己的任务进行对比。

相关阅读

在 Runable 的 Ultra 模式下尝试 GPT-6 Astra

感受前沿模型变革的最快方法是给它分配一项真实任务,而不是发送一条聊天信息。打开 Runable,将模型选择器切换到 Ultra,然后让 Astra 完成一件你通常需要预留整个下午时间的工作:一个工作应用、一个建模电子表格或一份研究报告。它支持免费试用,升级仅需一键完成。

Filed underLaunch
Written byEshaan Pawan

从您已有的想法开始

一句话足以开始行动。

免费开始