跳到主要内容

GPT-6.1 Sol

GPT-6.1 Sol 是 OpenAI 于 2026 年 9 月 29 日发布的 GPT-6 系列模型,定位在 GPT-6 Astra 与 GPT-6 Sol 之间:面向复杂编程、计算机使用和专业工作,同时把价格控制在 Astra 的约五分之一。本文依据 AIWiki 词条及其列出的 OpenAI 资料整理,价格、开放范围和评测数字均应以当前官方页面为准。

概览​

项目内容
模型名称GPT-6.1 Sol
API 模型标识gpt-6.1-sol
发布日期2026 年 9 月 29 日(DevDay 2026)
前代模型GPT-6 Sol
模型定位复杂编程、Agent、计算机使用和专业工作
上下文窗口1,050,000 tokens
最大输入 / 输出922,000 / 128,000 tokens
知识截止日期2026 年 4 月 30 日(资料所述)
输入与输出文本、图像输入;文本输出;不支持音频和视频
API 推理强度low、medium、high、xhigh、max

发布与可用范围​

OpenAI 的发布说明称,GPT-6.1 Sol 首批面向 Plus、Pro、Business、Enterprise 和 Edu 用户开放到 ChatGPT Work 与 Codex,发布时尚未在普通 Chat 模式提供。Enterprise 与 Edu 工作区可能需要管理员开启,Free 与 Go 方案不在首批开放范围内。具体入口会受账号、客户端和工作区设置影响,不能仅凭模型已经发布推断所有账号都能选择。

在 Codex CLI 中,资料给出的模型选择方式是:

codex --model gpt-6.1-sol

ChatGPT 与 Codex 中的推理档位以客户端显示为准,资料提到可从 Light 到 Ultra;API 则使用上表列出的 reasoning_effort 值。产品额度与 API 计费分别管理,使用前应分别查看对应页面。

API 能力与限制​

GPT-6.1 Sol 通过 Responses API 和 Chat Completions 提供服务,并支持 Multi-agent(Beta)。API 模型页列出的能力包括:

  • 流式输出、结构化输出和函数调用。
  • 文件搜索、网页搜索、图像输入和提示词缓存。
  • Responses API 内置的图像生成、代码解释器、托管 Shell、Apply Patch、Skills、Computer Use、MCP 和工具搜索。
  • US 与 EU 数据驻留;资料称 EU 数据驻留不提供 Fast 模式。

微调、预测输出、音频、embeddings 和 Realtime API 不在资料列出的支持范围内。GPT-6.1 Sol 不支持 Chat Completions 中的工具调用;需要推理与工具配合时,应优先使用 Responses API。它也不支持 none 推理强度,迁移时应把原来 GPT-6 Sol 的 none 改为 low 或更高档位。

一个最小 Responses API 请求可以写成:

curl https://api.openai.com/v1/responses \\
-H "Content-Type: application/json" \\
-H "Authorization: Bearer $OPENAI_API_KEY" \\
-d '{
"model": "gpt-6.1-sol",
"input": "从这份报告中提取三个可执行结论。",
"reasoning": {"effort": "medium"}
}'

API 密钥只能放在服务端或密钥管理系统中,不要写入浏览器代码、移动端包、Git 仓库或公开日志。

价格与缓存​

以下是资料记录的 API 标准价格,单位为每百万 tokens:

处理模式输入缓存输入缓存写入输出长上下文输入 / 输出
Standard$2.00$0.10$2.50$10.00$4.00 / $15.00
Batch、Flex$1.00$0.05$1.25$5.00$2.00 / $7.50
Fast$4.00$0.20$5.00$20.00$8.00 / $30.00

超过 272,000 个输入 tokens 时,整次请求按长上下文规则计费,输入与缓存费率翻倍,输出费率为 1.5 倍。GPT-6.1 Sol 的缓存输入价格是标准输入价格的 5%,比 GPT-6 Sol 的 10% 更低;不要把缓存折扣、处理模式和长上下文费率随意叠加,预算应以实际请求模式和当前定价页面为准。

OpenAI 将 GPT-6.1 Sol 的标准输入和输出价格描述为 GPT-6 Astra 的约五分之一。这个表述适用于未缓存的标准输入和输出,缓存输入的相对折扣另行计算。

与 GPT-6 Sol、GPT-6 Astra 的差异​

规格GPT-6.1 SolGPT-6 SolGPT-6 Astra
推理强度low 至 maxnone 至 maxlow 至 max
Chat Completions 工具调用不支持,使用 Responses仅 none不支持,使用 Responses
知识截止日期2026-04-302026-04-202026-04-30
缓存输入 / 1M tokens$0.10$0.20$1.00
标准输入 / 输出$2 / $10$2 / $10$10 / $50

可以把 GPT-6.1 Sol 理解为复杂工作中的成本平衡选项:相比 GPT-6 Sol,它更强调长时间 Agent、计算机使用和专业工作;相比 Astra,它保留较高能力上限,但价格和吞吐成本更适合重复运行。涉及最难的科学研究或极高风险任务时,仍应使用同一批真实样本与 Astra 做 A/B 测试,而不是只看型号名称。

OpenAI 发布的评测​

下表保留 AIWiki 对 OpenAI 发布图表的整理。数字来自特定数据集、推理档位和运行配置,不能直接当作所有任务的成功率。

评测GPT-6.1 Sol 最佳结果GPT-6 SolGPT-6 Astra
DeepSWE 1.175.2%(high,约 $0.65/任务)68.8%(max)74.1%(xhigh)
GDP.pdf32.0%(high)28.0%(high)32.2%(xhigh)
AutomationBench 1.0.636.1%(max)33.2%(xhigh)41.4%(max)
OSWorld 2.0 离线集71.4%(max)64.4%(max)73.5%(max)
Terminal-Bench Science 0.157.0%(max)27.6%(max)68.1%(max)
内部事实性评测(错误率,越低越好)4.1%(xhigh)4.5%(xhigh)3.9%(high)

OpenAI 的图表还显示,GPT-6.1 Sol 在不同推理档位之间并非越高越好。例如 DeepSWE 在 high 达到 75.2%,而 xhigh 与 max 均为 71.9%。因此可以先用 medium 或 high 做成本和质量基线,再根据真实任务决定是否提高档位。

独立的 Artificial Analysis Intelligence Index v4.3.2 在 2026 年 9 月 30 日记录 GPT-6.1 Sol(max)为 51.8,GPT-6 Sol 为 47.5,GPT-6 Astra 为 52.7。该指数是另一套测试和版本,不能与 OpenAI 发布图表混为同一排名。

安全与系统卡​

OpenAI 在 2026 年 9 月 29 日发布了《GPT-6 Astra System Card: GPT-6.1 Sol》补充文件。资料称,GPT-6.1 Sol 在 Preparedness Framework 中被评为:网络安全 Critical,生物与化学 High,AI 自我改进低于 High 阈值;OpenAI 对它应用了与 GPT-6 Astra 相同的 safeguards stack。此前 GPT-6 Sol 和 GPT-6 Luna 在网络安全上被归为 High。

安全评估中的数字来自模拟环境和专门设计的压力测试,不代表日常使用中的失败率。补充文件还记录了以下边界:

  • ExploitBench(max)为 99.7%,但 OpenAI 警告历史漏洞数据污染可能使结果偏高;近期漏洞的 Internal Port 测试成功率为 21.5%,可靠利用仍然困难。
  • 在 49,650 个匹配的模拟 Codex 任务中,GPT-6.1 Sol 出现严重错位行为标记的比例为 0.056%。
  • 在需要处理外部工具、权限和长时间运行的任务中,仍应把输入、工具动作、权限变化和完整轨迹纳入监控。

高能力不等于可以取消人工审批。文件删除、发送邮件、生产部署、权限变更和安全测试等动作应设置明确范围、最小权限、预览和人工确认。

适合什么任务​

可以优先测试 GPT-6.1 Sol 的场景包括:

  • 需要多步骤修改、运行和验证的软件工程任务。
  • 需要浏览器、代码、文件和多个工具协作的 Agent 工作流。
  • 复杂 PDF、财务材料、法律材料或其他专业文档的分析。
  • 需要重复运行、但又不希望承担 Astra 标准价格的长任务。
  • 需要长上下文和大量重复前缀的批处理流程。

选型时建议记录同一批样本的正确率、人工修改时间、工具失败率、缓存命中率、总 token 成本和端到端延迟。若任务涉及医疗、法律、财务或安全决策,还应保留领域专家审核。

资料来源​