🏠 首页 攻略 GPT-5.6 Sol 发布:OpenAI 最强视觉模型,价格直接砍半

GPT-5.6 Sol 发布:OpenAI 最强视觉模型,价格直接砍半

OpenAI 发布 GPT-5.6 Sol,号称史上最强视觉模型。Roboflow 实测显示检测能力提升明显,但价格却比预期低。本文深度解析 GPT-5.6 三档模型的定位差异、实际表现和推荐用法。

GPT-5.6 Sol 发布:OpenAI 史上最强视觉模型,价格直接砍半

今天 HN 炸了。GPT-5.6 Sol 发布的消息冲上首页,Roboflow 刚出了一份详细的 benchmark 报告,OpenRouter 也同步给出了定价。几个关键词:史上最强视觉模型、检测能力大幅提升、价格砍半。

GPT-5.6 家族三档定位

OpenAI 这次不是单发一个模型,而是同时推出三档——Sol、Terra、Luna。不是版本号升级,是定位分层。

Sol:旗舰,主打复杂推理、代码和 agentic 工作流。特别适合命令行操作、多步骤任务和长周期问题。

Terra:中等档位,平衡性能和成本,适合日常生产环境。

Luna:最便宜,速度最快,但保留了超越 GPT-5.5 的检测和计数能力。

这个策略和 Anthropic 的 Claude 系列很像——给用户一个明确的性能/成本选择空间。

Roboflow 实测数据:哪些能力真的提升了

Roboflow 用他们即将发布的 VLM benchmark 跑了一圈,结果挺有意思。

目标检测:从弱项变成可用

GPT-5.5 的检测能力一直被人诟病。GPT-5.6 Sol 这次明显补上了这个短板。

Sol 在检测任务上从 GPT-5.5 的落后状态,追平到了领先 VLM 的门槛。Terra 和 Luna 也有提升,但幅度不如 Sol。

一个重要技巧:让模型返回绝对 XYXY 像素坐标,而不是归一化坐标。 Roboflow 实测发现,用错坐标格式会让 GPT-5.6 的检测性能下降约 15%。

计数能力:全面进步

Sol 计数得分 73.0%,GPT-5.5 是 64.9%。Terra 67.6%,Luna 66.2%。

最难的不是简单计数,而是重叠物体。Roboflow 测试了紧密重叠的金属支架、药片泡罩包装里的空位和药丸。Sol 在大部分场景下能正确理解"只数某一类"的指令——比如只数指定区域里的弹孔。

但也有翻车。药片泡罩因为重复布局、反光和细微颜色差异,Sol 还是搞错了。

OCR:基本持平

Sol 的 OCR 平均分 90.7%,比 GPT-5.5 的 91.2% 只低 0.5 分。文本提取差距大一些(Sol 82.5% vs GPT-5.5 87.6%),但手写笔记和复杂场景文字读取表现不错。

轮胎侧面曲线上的胎纹文字、冰球转播的实时比分,这些高难度场景都读出来了。

延迟和成本:别只看价格

价格确实降了。OpenRouter 数据显示 GPT-5.6 Sol 的定价被砍了约 50%。

但代价也在。Sol 平均每张图处理时间约 10 秒,Terra 约 6 秒,Luna 约 5 秒。Luna 的速度已经接近 Gemini 3.5 Flash,同时检测能力还超过了 GPT-5.5。

更大问题是大图稳定性。Roboflow 发现,当图片达到 2000×2000 像素以上时,Sol 的检测框会变得不稳定——经常生成没有重叠的框,或者排列成不自然的直线。提升 reasoning effort 能改善,但 token 消耗、延迟和成本也会跟着涨。

怎么用最划算

如果你现在要选型,我的建议是:

  1. 日常文档处理、屏幕理解、agent 视觉任务 → 用 Sol,检测能力确实有质变
  2. 高吞吐量的检测/计数需求 → 用 Terra 或 Luna,速度和成本更友好
  3. 图片超过 2000px → 先 resize 或 crop,不然 Sol 的稳定性会出问题
  4. prompt 技巧 → 明确要求返回绝对 XYXY 像素坐标,别用归一化格式

GPT-5.6 让 OpenAI 在视觉模型领域从"还行"变成了"认真考虑"。但 Gemini 3.5 Flash 在高吞吐场景下仍然是性价比更高的选择。


参考:Roboflow GPT-5.6 评测 | OpenRouter GPT-5.6 Sol