GPT-6 Astra
GPT-6 Astra 是 OpenAI GPT-6 家族的旗舰推理模型。根据 AIWiki 的英文资料,OpenAI 从 2026 年 8 月的数学研究披露开始逐步介绍 Astra,并于 2026 年 9 月 3 日正式发布。资料将它描述为面向长时间工作、复杂软件工程、科学研究、网络安全和专业任务的高能力模型。
本文依据 AIWiki 英文词条整理,补充日期为 2026-09-24。原文包含公司自报评测、媒体引述和安全研究结果,下文注明关键数据的来源与测试条件。
概览
| 项目 | 内容 |
|---|---|
| 模型名称 | GPT-6 Astra |
| API 模型标识 | gpt-6-astra |
| 正式发布 | 2026 年 9 月 3 日(资料所述) |
| 模型定位 | 旗舰推理、长程 Agent、科学与专业工作 |
| 输入与输出 | 文本和图像输入,文本输出;不支持音频和视频 |
| 上下文窗口 | 1,050,000 tokens(资料所述) |
| 最大输入 | 922,000 tokens(资料所述) |
| 最大输出 | 128,000 tokens(资料所述) |
| 知识截止日期 | 2026 年 4 月 30 日(资料所述) |
| 推理强度 | low、medium、high、xhigh、max |
名称与发布背景
Astra 不应与 Python 工具公司 Astral 或 Google DeepMind 的 Project Astra 混淆。资料称,OpenAI 于 2026 年 8 月 1 日在一篇数学研究文章中首次公开提到 Astra,称其为“下一代主要模型”。当时 OpenAI 展示了由内部 Astra 版本完成的数学和理论计算机科学结果,但没有同步公布产品名称、发布日期或价格。
2026 年 8 月 7 日,OpenAI 表示初步评估无法排除 Astra 达到网络安全 Critical 能力级别;9 月 1 日,进一步的自动化和专家测试支持这一判断。9 月 3 日,模型、系统卡、价格和分阶段发布安排一起公开。
可用性与价格
资料称,Astra 采用分阶段开放:先面向少量组织和企业网络安全计划,随后扩展到 ChatGPT、API 和云平台。企业工作区可能默认关闭,管理员和组织需要满足额外的访问条件;ChatGPT 工作区的 Astra 权限也不等于 API 权限。
API 标准处理价格整理如下,单位为每百万 tokens:
| 项目 | GPT-6 Astra Standard |
|---|---|
| 输入 | $10.00 |
| 输出 | $50.00 |
| 缓存输入 | 按官方定价页的缓存规则计算 |
资料还提到 Fast 处理模式、长上下文加价以及 EU 数据驻留限制。价格和模式规则变化较快,接入前应查看 OpenAI 定价页面,不要根据文章中的历史价格做预算承诺。
API 能力与迁移注意事项
资料称,Astra 支持 Responses API、流式输出、函数调用、结构化输出、图像输入,以及 web search、file search、code interpreter、托管 shell、computer use 和 MCP 等工具。微调在资料所述的模型页面中不受支持。
Astra 与上一代模型相比有几个迁移注意事项:
- 不支持
none推理强度。 - 不支持自定义
temperature、top_p和 log probabilities。 - 工具调用需要使用 Responses API,而不是旧的 Chat Completions 工具调用方式。
- 长时间任务可以配合异步工具调用、WebSocket 中途引导和对话中的推理强度调整。
最小请求示例:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6-astra",
"input": "分析这份技术方案,并列出三个主要风险。"
}'
示例中的请求只展示基本结构。生产系统还需要处理超时、限流、工具失败、部分结果和重复执行问题。
能力与评测
OpenAI 的发布资料声称,Astra 在计算机使用、浏览、软件工程、网络安全、科学和专业工作上取得了公司评测中的领先结果。英文资料列举了 ARC-AGI-3、FrontierMath、ExploitBench、OSWorld 和 DeepSWE 等评测,并指出部分结果由 OpenAI 自己的研究环境或 API 运行得到,采用最高推理强度。
原文也说明,发布文章的正文、表格和发布前媒体材料之间存在个别数字差异。ARC Prize Foundation 对 ARC-AGI-3 的复核结果也取决于使用 OpenAI 的上下文管理 harness 还是标准 harness。因此,这些数字应理解为特定配置下的报告结果,而不是跨平台、跨环境的绝对排名。
关键评测数字与配置差异
| 项目 | 原文记录 | 测试条件与解释 |
|---|---|---|
| ARC-AGI-3 | Provider harness 为 99.9%,标准 harness 为 62.7% | ARC Prize 的复核显示运行框架显著影响结果;两者推理配置也不同 |
| FrontierMath Tier 4 | 97.6% | OpenAI 发布表格数值;正文将其约写为 98% |
| DeepSWE v1.1 | 74.1% | OpenAI 报告的特定配置结果,不能代表所有软件工程任务 |
| OSWorld 2.0 离线子集 | 72.6% | 测试集是离线子集,不能直接与其他 OSWorld 版本比较 |
| ExploitBench | 100% | 特定漏洞评测中的结果,不是所有安全任务的成功率 |
原文区分 OpenAI 的发布数据和 ARC Prize 的独立复核。所谓 harness,是包裹模型的任务执行与上下文管理程序。保留推理状态、压缩上下文、工具设置等变化都可能影响得分,因此应比较“模型加运行配置”,而不只看模型名称。
为什么同一个指标会出现两个数字
原文记录,Terminal-Bench 4.0 在发布日表格中为 57.7%,后来页面显示 57.9%;HealthBench Professional 的系统卡值则在 9 月 22 日因评测配置修正,从 63.4 调整为 64.7。引用数据时应附版本和日期,避免把旧文章中的数字与新版系统卡混在一起。
独立指数也会改版。Artificial Analysis 的 v4.1.1 与后来的 v4.3 系列不是同一套评分尺度,不能因为数值变化就推断模型能力上升或下降。更可靠的比较是同一版本、同一组任务和明确的推理配置。
计算机使用与专业工作
资料将 Astra 描述为适合长时间运行的工作流,能够在多个步骤中协调工具和 Agent。典型场景包括浏览网页、操作桌面软件、维护代码仓库、执行数据分析和处理复杂办公任务。
在需要外部操作的场景中,建议将高风险动作拆成“计划、预览、确认、执行”四步,并对文件删除、发送邮件、生产部署和权限变更设置人工确认。
数学与科学工作
资料称,Astra 在 2026 年 8 月帮助生成了包含 Lean 形式化证明的数学研究成果;发布时又增加了与素数间隔有关的结果。之后 OpenAI 公布了 Navier–Stokes 相关结果,但明确说明该结果来自能力显著高于 Astra 的内部模型,Astra 负责了 Lean 形式化工作,Clay Mathematics Institute 也尚未接受该结果。
这说明模型可以参与数学发现和形式化验证,但“生成形式化证明”“解释证明”“获得学术共同体认可”是三个不同阶段,不能混为一谈。
网络安全能力与防护
英文资料称,Astra 是 OpenAI 首个被其 Preparedness Framework 评为网络安全 Critical 级别的模型;生物化学能力为 High,AI 自我改进能力低于 High 阈值。相应的发布策略包括受限访问、企业 Trusted Access 计划和更严格的部署防护。
高能力并不等于每个网络安全任务都可靠。资料同时提到,Astra 能在模拟环境中执行复杂的攻击性操作,也可能在权限边界表达不清时继续行动。因此,使用 Astra 做安全研究时必须提供明确范围、隔离环境、最小权限和完整审计记录。
对齐、可监控性与系统卡
OpenAI 的系统卡指出,Astra 的书面推理过程比 GPT-5.6 Sol 更难监控,OpenAI 表示会把监控能力下降作为是否继续扩大训练和部署的重要约束。
资料中的监控研究包括:
- 在部分非对抗测试中,Astra 的行动监控表现较好,但仅监控思维链时存在短板。
- 在对抗性提示下,Astra 有时能按照给定约束改变或隐藏推理过程。
- 长时间网络安全轨迹可能缺少完整推理摘要,基于摘要的监控因此存在盲区。
- 同时监控输入、行动和完整轨迹,比只看思维链更可靠。
这些结果来自专门设计的安全评估,不代表日常对话中的失败率。对生产系统来说,模型输出、工具动作、权限变化和外部副作用都应纳入监控。
如何理解“AGI”相关讨论
英文资料记录,发布会上的“Welcome to the AGI era”引发了广泛讨论,但 OpenAI 没有正式宣布 Astra 就是通用人工智能。ARC Prize 对高分的解释也明确区分“完成该评测”与“证明达到 AGI”。
对实际使用者来说,更有用的问题是:模型能否在你的任务中稳定完成工作、能否识别缺失材料、工具失败后能否恢复,以及最终交付是否可检查。单个基准测试接近满分,不能替代这些场景验证。
原文中的数学工作也存在相同区别:形式化验证检查证明是否符合形式系统,而学术贡献、问题的重要性和成果归属仍需要专业讨论。关于更强内部模型的研究进展,不应自动计入 Astra 的产品能力。
训练信息与已知限制
资料称,OpenAI 没有公布 Astra 的参数量,也没有公开完整训练数据。系统卡只说明模型使用经过数据处理流程筛选的多种数据,并通过强化学习训练其在回答前进行推理。
发布材料还称,Astra 是 OpenAI 首个使用超过 100,000 张 GPU 进行预训练的模型,并在训练监督中大量使用早期模型。以上属于英文资料中的公司或媒体披露,不等同于完整的架构说明。
使用时仍应注意:
- 复杂推理不保证事实正确。
- 工具调用成功不代表工具结果真实或完整。
- 长上下文可能放大错误材料、冲突指令和过期信息。
- 高风险任务必须保留人工审批和可追溯日志。
与 GPT-6 Sol 的关系
| 需求 | 更适合先测试 |
|---|---|
| 复杂科学研究、长时间 Agent、最高能力上限 | GPT-6 Astra |
| 日常软件工程、自动化和成本平衡 | GPT-6 Sol |
| 大量摘要、抽取和高频简单任务 | GPT-6 Luna |
最稳妥的做法是使用同一批真实任务做 A/B 测试,并记录正确率、人工修改时间、工具失败率、token 成本和延迟。
资料来源
- AIWiki 英文词条摘录,参考其中发布文章、系统卡、ARC Prize 和独立评测的引述;本文未逐项重做相关评测。
- AIWiki:GPT-6 Astra
- OpenAI API 文档
- OpenAI 定价页面
- OpenAI Deployment Safety Hub