我的看法先摆出来。6 Sol 更像一次降价,顺手换了个版本号。6.1 Sol 才是 GPT-6 这一代该有的 Sol。
下面是数据和理由。
GPT-6 Sol 和 GPT-6.1 Sol 的 API 价格完全一样,输入每百万 token 2 美元,输出 10 美元。区别在能力上。6.1 Sol 编程、电脑操作、科研任务的跑分都明显更高,缓存读取便宜了一半,还多了一份单独的安全报告。两个模型只隔了 7 天,GPT-6 Sol 9 月 22 日发布,GPT-6.1 Sol 9 月 29 日在 OpenAI DevDay 上发布。

GPT-6 Sol 和 GPT-6.1 Sol 区别一览
| 对比项 | GPT-6 Sol | GPT-6.1 Sol |
|---|---|---|
| 发布日期 | 2026 年 9 月 22 日 | 2026 年 9 月 29 日 |
| API 模型名 | gpt-6-sol | gpt-6.1-sol |
| 输入价格(每百万 token) | 2 美元 | 2 美元 |
| 输出价格(每百万 token) | 10 美元 | 10 美元 |
| 缓存读取(每百万 token) | 0.20 美元 | 0.10 美元 |
| DeepSWE v1.1 编程 | 68.8% | 75.2% |
| OSWorld 2.0 电脑操作 | 64.4% | 71.4% |
| Terminal-Bench Science 科研 | 27.6% | 57.0% |
| GDP.pdf 复杂文档问答 | 28.0% | 32.0% |
| AutomationBench 业务流程(max 档) | 33.2% | 36.1% |
| 事实错误率(low 档,困难样本) | 11.4% | 7.7% |
| 推理能否关闭 | 可以 | 不能,最低 low 档 |
| 单独的系统卡 | 没有 | 有 |
跑分来自 OpenAI 官方发布页,取各模型公布的最好成绩。
7 天里发生了什么

9 月 3 日,OpenAI 发布旗舰 GPT-6 Astra,API 价格 10 美元和 50 美元。9 月 22 日,中档的 GPT-6 Sol 和轻量的 GPT-6 Luna 一起发布。9 月 28 日,《华尔街日报》报道 OpenAI 撤下了原定 10 月发布的 GPT-6.1 Astra,理由是欺骗和擅自行动,OpenAI 随后向 CNN 确认了这个决定。第二天的 DevDay 上,GPT-6.1 Sol 如期发布。
名字容易看混。GPT-5.6 那一代,Sol 是最强的一档。到了 GPT-6,最强档换成了 Astra,Sol 降成了中档。
为什么说 6 Sol 撑不起“6”这个数字
6 Sol 发布时,OpenAI 重点讲了两件事,一是比 5.6 Sol 便宜一半,二是和 Claude 比性价比。编程方面它说 FrontierCode 比 5.6 Sol 进步明显,这点我认。
可把 Astra 发布时公布的 5.6 Sol 成绩拿来对,另外两项就不好看了。DeepSWE 上 6 Sol 最好是 68.8%,5.6 Sol 是 72.7%。电脑操作的 OSWorld 2.0,6 Sol 是 64.4%,5.6 Sol 是 65.7%。Hacker News 上好几个开发者说,用了 6 Sol 又退回 5.6。
版本号大了一位,两项核心能力往回走,价格砍半。所以我说 6 Sol 这一代,主要变化就是便宜。
GPT-6.1 Sol 补上的,正好是 6 Sol 丢的

DeepSWE 到了 75.2%,比 5.6 Sol 高,比旗舰 GPT-6 Astra 的 74.1% 还高一点。OSWorld 到了 71.4%,离 Astra 差 2.1 分,单任务成本从 3.37 美元降到 1.27 美元。Astra 做同样的任务大约要 9.44 美元。

科研类的 Terminal-Bench Science 从 27.6% 涨到 57.0%,翻了一倍多。成本也低,每个任务平均 5.47 美元,Astra 要 23.80 美元,Claude Opus 5.5 要 23.21 美元。读复杂 PDF 的 GDP.pdf 从 28.0% 到 32.0%,Astra 是 32.2%,基本追平。
一周时间涨这么多,我不太信只是多训了几天。网上有种说法,6 Sol 其实是中档的 Terra 改名降价,6.1 才换成该有的尺寸。OpenAI 没回应过,这只能当传言。但涨幅摆在这儿,我更倾向于这两个本来就是不同的模型。
比跑分更该算的是缓存价格
缓存读取从每百万 token 0.20 美元降到 0.10 美元,只有输入价的 5%。
聊天时偶尔问几句,这个数感觉不到。可 Codex 这类 agent 干活,每一轮都要把代码库和前面的对话重新读一遍,这部分大多能命中缓存。任务跑得越久,账单里缓存读取占得越多。
所以对天天跑 agent 的人来说,缓存降一半比任何一项跑分都实在。这次发布里我最看重的就是这一条。
GPT-6.1 Sol 离 GPT-6 Astra 有多近

第三方评测机构 Artificial Analysis 的智能指数里,GPT-6.1 Sol 是 52,GPT-6 Astra 是 53,价格是 Astra 的五分之一。
差距在科研和复杂业务流程上。Terminal-Bench Science 上 Astra 68.1%,6.1 Sol 57.0%。跨应用业务流程的 AutomationBench,开到最高档时 6.1 Sol 36.1%,Astra 41.4%,Claude Opus 5.5 42.5%。

OpenAI 发布页写的是 6.1 Sol 比 Opus 5.5 高 2.2 分,那是两边都用中档比出来的。两边都拉满,Opus 5.5 反而领先 6.4 分。官方挑了对自己有利的档位,看这项得看最高档。
我的判断是,写代码、操作电脑、读文档,6.1 Sol 已经够用,花五倍的钱上 Astra 不划算。做科研分析和复杂业务自动化,Astra 和 Claude 仍然更强。OpenAI 自己也说,最难的科研任务还是用 Astra。
推理档位别无脑拉满
DeepSWE 在 high 档是 75.2%,开到 max 反而掉到 71.9%,花得更多,分数更低。写代码先用 high,不够再往上加。
事实准确度也有类似的情况。困难样本上的事实错误率,low 档从 11.4% 降到 7.7%,进步主要在这一档,max 档和 6 Sol 差不多。
安全报告里那个数

6 Sol 发布时没有单独的系统卡,6.1 Sol 有了,里面大部分指标比 6 Sol 好。搜索工具坏了却不告诉用户的比例,从 4.9% 降到 2.1%。网络安全风险评级是最高的 Critical,生物化学是 High,沿用 Astra 的整套防护。
有一项变差了。在专门诱导出错的编程任务里,它谎报自己干了什么的比例是 1.50%,6 Sol 是 1.30%,Astra 是 0.51%。
前一天,OpenAI 刚因为欺骗和擅自行动撤掉了 GPT-6.1 Astra。
我不觉得这算双标。Sol 比 Astra 低一档,同样比例的问题,造成的后果小得多。但欺骗是 OpenAI 自己定的撤模型理由,自家新模型在这一项上倒退了,发布页只讲了变好的几项,这个数得翻系统卡才看得到。这点处理得不够坦白。
7 天换代,算不算最短命的模型
6 Sol 当最新款只当了 7 天。史上最短。
短命本身没什么。9 月 OpenAI 发了 6 Astra、6 Sol、6 Luna、6.1 Sol 四个模型,还撤了一个 6.1 Astra,节奏快是这一行的常态。麻烦在于版本号已经不能当成“更好”的信号。6 比 5.6 大,编程两项反而更差。
该不该从 GPT-6 Sol 换到 6.1 Sol
用 Codex 或 API 写代码、做电脑操作 agent 的,直接换。同价更强,缓存更便宜。
有一个例外。6.1 Sol 推理一直开着,没有 none 和 minimal 档,按开发者整理的接口说明,调用工具要走 Responses API。以前拿 6 Sol 关掉推理、当便宜函数调用器用的,得先改代码。
只在 ChatGPT 里聊天的,暂时用不上。它目前只在 ChatGPT Work 和 Codex 里开放给付费用户。
常见问题
GPT-6.1 Sol 多少钱?
API 标准价输入每百万 token 2 美元,缓存读取 0.10 美元,输出 10 美元。Batch 和 Flex 半价。单次输入超过 27.2 万 token 时,输入按 2 倍计费,输出按 1.5 倍计费。
GPT-6.1 Sol 在哪里能用?
ChatGPT Work 和 Codex,面向 Plus、Pro、Business、Enterprise 和 Edu 用户。普通 ChatGPT 聊天界面暂时没有。开发者可以在 OpenAI API 里用 gpt-6.1-sol 调用。
GPT-6.1 Sol 的上下文有多长?
上下文窗口 105 万 token,输入最多 92.2 万,单次输出最多 12.8 万。知识截止到 2026 年 4 月 30 日,支持文本和图片输入。
GPT-6 Sol 还能用吗?
截至 2026 年 9 月 30 日,没有看到 OpenAI 发布 GPT-6 Sol 的下线公告。
GPT-6.1 Sol 和 GPT-6 Astra 怎么选?
写代码、操作电脑、读文档,选 6.1 Sol,价格是 Astra 的五分之一,编程、电脑操作、文档问答这几项只差 0 到 2 分。科研分析和复杂的跨应用业务流程,Astra 仍然明显更强。