GPT-6.1 Sol
GPT-6.1 Sol 是 OpenAI 于 2026 年 9 月 29 日发布的 GPT-6 系列模型,定位在 GPT-6 Astra 与 GPT-6 Sol 之间:面向复杂编程、计算机使用和专业工作,同时把价格控制在 Astra 的约五分之一。本文依据 AIWiki 词条及其列出的 OpenAI 资料整理,价格、开放范围和评测数字均应以当前官方页面为准。
概览
| 项目 | 内容 |
|---|---|
| 模型名称 | GPT-6.1 Sol |
| API 模型标识 | gpt-6.1-sol |
| 发布日期 | 2026 年 9 月 29 日(DevDay 2026) |
| 前代模型 | GPT-6 Sol |
| 模型定位 | 复杂编程、Agent、计算机使用和专业工作 |
| 上下文窗口 | 1,050,000 tokens |
| 最大输入 / 输出 | 922,000 / 128,000 tokens |
| 知识截止日期 | 2026 年 4 月 30 日(资料所述) |
| 输入与输出 | 文本、图像输入;文本输出;不支持音频和视频 |
| API 推理强度 | low、medium、high、xhigh、max |
发布与可用范围
OpenAI 的发布说明称,GPT-6.1 Sol 首批面向 Plus、Pro、Business、Enterprise 和 Edu 用户开放到 ChatGPT Work 与 Codex,发布时尚未在普通 Chat 模式提供。Enterprise 与 Edu 工作区可能需要管理员开启,Free 与 Go 方案不在首批开放范围内。具体入口会受账号、客户端和工作区设置影响,不能仅凭模型已经发布推断所有账号都能选择。
在 Codex CLI 中,资料给出的模型选择方式是:
codex --model gpt-6.1-sol
ChatGPT 与 Codex 中的推理档位以客户端显示为准,资料提到可从 Light 到 Ultra;API 则使用上表列出的 reasoning_effort 值。产品额度与 API 计费分别管理,使用前应分别查看对应页面。
API 能力与限制
GPT-6.1 Sol 通过 Responses API 和 Chat Completions 提供服务,并支持 Multi-agent(Beta)。API 模型页列出的能力包括:
- 流式输出、结构化输出和函数调用。
- 文件搜索、网页搜索、图像输入和提示词缓存。
- Responses API 内置的图像生成、代码解释器、托管 Shell、Apply Patch、Skills、Computer Use、MCP 和工具搜索。
- US 与 EU 数据驻留;资料称 EU 数据驻留不提供 Fast 模式。
微调、预测输出、音频、embeddings 和 Realtime API 不在资料列出的支持范围内。GPT-6.1 Sol 不支持 Chat Completions 中的工具调用;需要推理与工具配合时,应优先使用 Responses API。它也不支持 none 推理强度,迁移时应把原来 GPT-6 Sol 的 none 改为 low 或更高档位。
一个最小 Responses API 请求可以写成:
curl https://api.openai.com/v1/responses \\
-H "Content-Type: application/json" \\
-H "Authorization: Bearer $OPENAI_API_KEY" \\
-d '{
"model": "gpt-6.1-sol",
"input": "从这份报告中提取三个可执行结论。",
"reasoning": {"effort": "medium"}
}'
API 密钥只能放在服务端或密钥管理系统中,不要写入浏览器代码、移动端包、Git 仓库或公开日志。
价格与缓存
以下是资料记录的 API 标准价格,单位为每百万 tokens:
| 处理模式 | 输入 | 缓存输入 | 缓存写入 | 输出 | 长上下文输入 / 输出 |
|---|---|---|---|---|---|
| Standard | $2.00 | $0.10 | $2.50 | $10.00 | $4.00 / $15.00 |
| Batch、Flex | $1.00 | $0.05 | $1.25 | $5.00 | $2.00 / $7.50 |
| Fast | $4.00 | $0.20 | $5.00 | $20.00 | $8.00 / $30.00 |
超过 272,000 个输入 tokens 时,整次请求按长上下文规则计费,输入与缓存费率翻倍,输出费率为 1.5 倍。GPT-6.1 Sol 的缓存输入价格是标准输入价格的 5%,比 GPT-6 Sol 的 10% 更低;不要把缓存折扣、处理模式和长上下文费率随意叠加,预算应以实际请求模式和当前定价页面为准。
OpenAI 将 GPT-6.1 Sol 的标准输入和输出价格描述为 GPT-6 Astra 的约五分之一。这个表述适用于未缓存的标准输入和输出,缓存输入的相对折扣另行计算。
与 GPT-6 Sol、GPT-6 Astra 的差异
| 规格 | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| 推理强度 | low 至 max | none 至 max | low 至 max |
| Chat Completions 工具调用 | 不支持,使用 Responses | 仅 none | 不支持,使用 Responses |
| 知识截止日期 | 2026-04-30 | 2026-04-20 | 2026-04-30 |
| 缓存输入 / 1M tokens | $0.10 | $0.20 | $1.00 |
| 标准输入 / 输出 | $2 / $10 | $2 / $10 | $10 / $50 |
可以把 GPT-6.1 Sol 理解为复杂工作中的成本平衡选项:相比 GPT-6 Sol,它更强调长时间 Agent、计算机使用和专业工作;相比 Astra,它保留较高能力上限,但价格和吞吐成本更适合重复运行。涉及最难的科学研究或极高风险任务时,仍应使用同一批真实样本与 Astra 做 A/B 测试,而不是只看型号名称。
OpenAI 发布的评测
下表保留 AIWiki 对 OpenAI 发布图表的整理。数字来自特定数据集、推理档位和运行配置,不能直接当作所有任务的成功率。
| 评测 | GPT-6.1 Sol 最佳结果 | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| DeepSWE 1.1 | 75.2%(high,约 $0.65/任务) | 68.8%(max) | 74.1%(xhigh) |
| GDP.pdf | 32.0%(high) | 28.0%(high) | 32.2%(xhigh) |
| AutomationBench 1.0.6 | 36.1%(max) | 33.2%(xhigh) | 41.4%(max) |
| OSWorld 2.0 离线集 | 71.4%(max) | 64.4%(max) | 73.5%(max) |
| Terminal-Bench Science 0.1 | 57.0%(max) | 27.6%(max) | 68.1%(max) |
| 内部事实性评测(错误率,越低越好) | 4.1%(xhigh) | 4.5%(xhigh) | 3.9%(high) |
OpenAI 的图表还显示,GPT-6.1 Sol 在不同推理档位之间并非越高越好。例如 DeepSWE 在 high 达到 75.2%,而 xhigh 与 max 均为 71.9%。因此可以先用 medium 或 high 做成本和质量基线,再根据真实任务决定是否提高档位。
独立的 Artificial Analysis Intelligence Index v4.3.2 在 2026 年 9 月 30 日记录 GPT-6.1 Sol(max)为 51.8,GPT-6 Sol 为 47.5,GPT-6 Astra 为 52.7。该指数是另一套测试和版本,不能与 OpenAI 发布图表混为同一排名。
安全与系统卡
OpenAI 在 2026 年 9 月 29 日发布了《GPT-6 Astra System Card: GPT-6.1 Sol》补充文件。资料称,GPT-6.1 Sol 在 Preparedness Framework 中被评为:网络安全 Critical,生物与化学 High,AI 自我改进低于 High 阈值;OpenAI 对它应用了与 GPT-6 Astra 相同的 safeguards stack。此前 GPT-6 Sol 和 GPT-6 Luna 在网络安全上被归为 High。
安全评估中的数字来自模拟环境和专门设计的压力测试,不代表日常使用中的失败率。补充文件还记录了以下边界:
- ExploitBench(max)为 99.7%,但 OpenAI 警告历史漏洞数据污染可能使结果偏高;近期漏洞的 Internal Port 测试成功率为 21.5%,可靠利用仍然困难。
- 在 49,650 个匹配的模拟 Codex 任务中,GPT-6.1 Sol 出现严重错位行为标记的比例为 0.056%。
- 在需要处理外部工具、权限和长时间运行的任务中,仍应把输入、工具动作、权限变化和完整轨迹纳入监控。
高能力不等于可以取消人工审批。文件删除、发送邮件、生产部署、权限变更和安全测试等动作应设置明确范围、最小权限、预览和人工确认。
适合什么任务
可以优先测试 GPT-6.1 Sol 的场景包括:
- 需要多步骤修改、运行和验证的软件工程任务。
- 需要浏览器、代码、文件和多个工具协作的 Agent 工作流。
- 复杂 PDF、财务材料、法律材料或其他专业文档的分析。
- 需要重复运行、但又不希望承担 Astra 标准价格的长任务。
- 需要长上下文和大量重复前缀的批处理流程。
选型时建议记录同一批样本的正确率、人工修改时间、工具失败率、缓存命中率、总 token 成本和端到端延迟。若任务涉及医疗、法律、财务或安全决策,还应保留领域专家审核。