GPT-6 Sol
GPT-6 Sol 是 OpenAI GPT-6 系列中的通用推理模型,定位于较低成本的复杂任务处理。根据 AIWiki 的英文资料,OpenAI 于 2026 年 9 月 22 日发布 GPT-6 Sol 和 GPT-6 Luna,重点介绍 API 价格、提示词缓存和生产型任务中的成本表现。
本文依据 AIWiki 英文词条整理,补充日期为 2026-09-24。下文保留公司自报数据与独立评测的区别;价格、模型标识和可用范围以当前官方文档与账户显示为准。
概览
| 项目 | 内容 |
|---|---|
| 模型名称 | GPT-6 Sol |
| API 模型标识 | gpt-6-sol |
| 发布日期 | 2026 年 9 月 22 日(资料所述) |
| 模型定位 | 通用推理、软件开发和生产型 Agent |
| 输入与输出 | 支持文本和图像输入,文本输出 |
| 知识截止日期 | 2026 年 4 月 20 日(资料所述) |
| 上下文窗口 | 1,050,000 tokens(资料所述) |
| 最大输出 | 128,000 tokens(资料所述) |
| 推理强度 | none、low、medium、high、xhigh、max |
发布与可用性
GPT-6 Sol 与 GPT-6 Luna 是 GPT-6 家族在 Astra 之后推出的成本更低的模型。资料称,Sol 面向需要较强推理能力、但不希望为每个请求支付旗舰模型价格的开发者;Luna 则进一步面向摘要、抽取和高并发的聚焦任务。
原文记录,发布时 Sol 与 Luna 开放到 API、ChatGPT Work 和 Codex,尚未在普通 Chat 模式开放。产品入口、套餐和 API 项目权限需要分别确认,不能仅凭“已在 ChatGPT 发布”推断所有对话模式都可选择它。
API 价格
资料整理的公开价格如下,单位为每百万 tokens:
| 项目 | GPT-6 Sol |
|---|---|
| 输入 | $2.00 |
| 输出 | $10.00 |
| 缓存输入 | 约为未缓存输入价格的 10% |
英文资料将 Sol 与 GPT-5.6 Sol 的促销价格作比较,并指出新模型的标准价格大约降低了一半。这里的“降低”取决于所比较的促销周期和处理模式,不能直接当作永久价格承诺。正式上线前请查看 OpenAI 定价页面。
能力与适用场景
GPT-6 Sol 适合以下任务:
- 需要多步分析,但不一定需要旗舰模型最长推理时间的工作。
- 代码生成、代码审查、调试和软件工程 Agent。
- 文档总结、信息抽取、分类、改写和结构化输出。
- 结合工具调用的自动化流程和批量任务。
- 对成本敏感、请求量较大的生产系统。
资料中的 OpenAI 内部对比强调 Sol 在部分自动化任务中的成本优势和事实性改善,但软件工程与计算机使用的具体得分并非全面超过 GPT-5.6 Sol。所用环境、推理强度和任务样本会影响结果,下面的评测小节保留了相关差异。选择模型时,应使用自己的代表性任务进行小规模评估。
API 与开发者能力
资料称,GPT-6 Sol 支持 Responses API、流式输出、函数调用、结构化输出和图像输入。开发者可以通过不同的 reasoning effort 调整速度、成本和推理深度。
一个最小请求可以写成:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6-sol",
"input": "用三句话总结这份文档。"
}'
API 密钥只能放在服务端或密钥管理系统中。不要把密钥写入浏览器代码、移动端包、Git 仓库或公开日志。
提示词缓存变化
GPT-6 系列同时引入了改进后的提示词缓存机制。资料提到:
- 可复用的共享前缀可以在约 30 分钟窗口内获得缓存收益。
- OpenAI 提供缓存命中率查看和诊断工具。
- 开发者可以显式设置缓存断点,控制哪些前缀进入缓存。
- 在不同响应之间调整推理强度,不一定会破坏已有缓存。
对于长系统提示词、重复上下文和批量 Agent 任务,缓存命中率可能比单纯比较 token 单价更影响实际成本。上线前应记录输入长度、缓存命中率、每次任务成本和端到端延迟。
标准价格之外的费用条件
原文记录的 Standard 输入、输出单价分别为每百万 $2 和 $10。缓存读取为未缓存输入价格的 10%,缓存写入为 1.25 倍;长上下文请求超过 272,000 输入 tokens 时,整次请求按长上下文规则计算,输入和缓存费率翻倍,输出费率为 1.5 倍。
同一份资料还记录 Batch 与 Flex 价格为 Standard 的一半,Fast 为两倍,区域处理另加 10%。这些是原文所记载的价格条件,不应将不同模式的折扣任意叠加。估算预算时,记录实际请求采用的模式,再对照当前定价页确认支持范围。
对于重复处理相似文档的任务,缓存收益取决于可复用前缀是否符合规则。把无关内容加长以追求缓存没有意义;更适合缓存的是稳定的说明、术语和共同材料。
工具调用与模型限制
原文列出 Responses API、Chat Completions 和 Batch 支持,但说明在 Chat Completions 中使用函数调用时,推理强度须为 none;需要推理与工具配合时,优先参考 Responses API 的对应文档。Sol 与 Astra 的参数支持并不完全相同,迁移时应逐项核对。
原文还将微调、embeddings、音频和 Realtime API 列为不支持的能力。通过工具生成图片,与模型本身的文本输出能力是两个层次,不应把工具清单直接当作模型原生输入输出类型。
评测结果如何理解
英文资料汇总了 OpenAI 在自动化、软件工程、计算机使用和事实性方面的内部评测,也引用了 Artificial Analysis、TechCrunch、The New Stack 和 The Decoder 等外部资料。不同评测给出的结论并不完全一致:有些任务显示 Sol 进步明显,有些任务则与上一代接近,甚至出现回退。
因此,评测数字适合用于提出测试假设,不适合直接替代选型验证。建议至少准备以下三类样本:
- 真实业务中的常见任务。
- 容易出错的边界任务。
- 需要严格格式、工具调用或长上下文的任务。
原文中的具体对比
以下保留英文资料正文中明确给出的数字;没有随粘贴文本提供的完整图表不作补造。
| 评测 | 原文记录的结果 | 应如何阅读 |
|---|---|---|
| DeepSWE | Sol 在 max 为 68.8%,Fable 5 在 xhigh 为 69.9% | 得分接近,但推理设置不同 |
| 同一 DeepSWE 图表 | GPT-5.6 Sol 为 72.7%,Opus 5 为 73.7% | 新 Sol 不是所有任务都高于前代 |
| OSWorld 2.0 离线集 | Sol 在 xhigh 为 60.5%,Opus 5 在 medium 为 60.3% | 原文重点比较的是这两个配置的任务成本 |
| Artificial Analysis Intelligence Index v4.3.2 | GPT-6 Sol 为 47.5,GPT-5.6 Sol 为 47.0,均为 max | 独立指数中的提升幅度有限 |
原文把前几项归于 OpenAI 发布图表,最后一项归于 Artificial Analysis 于 2026-09-23 的数据。它还指出 GDPval-AA 中 Sol 的结果较 GPT-5.6 Sol 低约 100 Elo,外部报道将问题与呈现质量和结果不完整联系起来。因此,“便宜一半”和“能力全面翻倍”不是同一回事。
这些结果更适合用来设计自己的测试:软件任务检查修改是否完整,文档任务检查交付质量,自动化任务检查工具调用与异常处理。不可把某个评测的成本降幅直接当作自己业务的节省比例。
安全与限制
资料称,OpenAI 没有为 Sol 单独发布完整的系统卡,而是在 GPT-6 Astra 系统卡的附录中补充 Sol 和 Luna 的结果。该资料将 Sol 归入网络安全以及生物化学能力的 High 级别,并沿用 GPT-5.6 家族的一部分防护措施。
英文资料也提到,Sol 在部分越狱、拒答和生产流量评估中有所改善,但某些健康领域评测的分数变化与回答长度下降有关。更短的回答不一定代表更可靠,开发者仍应对医疗、法律、财务和安全场景设置人工审核与领域规则。
与 GPT-6 Astra 的关系
Astra 是 GPT-6 家族的旗舰模型,Sol 则面向更低成本和更高吞吐量的生产任务。选择时可以这样理解:
| 需求 | 优先考虑 |
|---|---|
| 复杂研究、长时间 Agent 工作、最高能力上限 | GPT-6 Astra |
| 成本、吞吐量和日常生产任务平衡 | GPT-6 Sol |
| 摘要、抽取和高频简单任务 | GPT-6 Luna |
这只是资料中的定位概括,不代表所有任务都遵循同一排序。实际结果取决于提示词、工具、上下文和评测集。
资料来源
- AIWiki 英文词条摘录,参考其中 OpenAI 发布材料、系统卡和独立评测的引述;本文未逐项重做相关评测。
- AIWiki:GPT-6 Sol
- OpenAI API 文档
- OpenAI 定价页面