GPT-5.6 Sol被评OpenAI最强视觉模型

Roboflow于2026年7月16日发布评测文章,称OpenAI此前推出的GPT-5.6 Sol是其迄今最强的视觉模型。Roboflow同时表示,OpenAI在评测发布前一周推出了GPT-5.6系列,包括Sol、Terra、Luna三款模型。这次评测把Sol放在目标检测和图像计数两类任务中,与GPT-5.5及同系列模型对比,结果来自Roboflow自有的VLM基准测试。

检测和计数拉开差距

在目标检测任务里,Sol的成绩明显高于上一代。Roboflow给出的mAP@50结果显示,GPT-5.6 Sol为46.2,GPT-5.5只有13.8。mAP@50通常用于衡量模型找到物体位置并判断类别的综合能力,分数提升说明Sol在框选和识别环节更完整。

  • 目标检测mAP@50:GPT-5.6 Sol为46.2
  • 目标检测mAP@50:GPT-5.5为13.8
  • 图像计数准确率:GPT-5.6 Sol为73.0%
  • 图像计数准确率:Terra为67.6%
  • 图像计数准确率:Luna为66.2%
  • 图像计数准确率:GPT-5.5为64.9%

图像计数是另一类常见但容易失分的任务。画面中的物体如果过小、密集或相互遮挡,模型很容易给出模糊数量。Sol的73.0%准确率高于Terra、Luna和GPT-5.5,说明它在需要逐个确认画面元素时更可靠。

大尺寸图像是明确短板

评测也给出了Sol的适用边界。Roboflow称,OpenAI团队向他们确认,Sol在约2000x2000像素及以上的大图像上稳定性下降。OpenAI同时提到,提高推理力度可以改善这一问题。

这条信息对开发者很实际。高分辨率图像常见于工业质检、文档扫描、地图截图和细目标识别场景。若原图超过模型稳定处理范围,平均基准分数再高,也不能直接代表真实业务效果。开发者可能需要测试原始分辨率下的输出,再决定是否切分图像或增加推理资源。

第三方评测仍待完整公开

OpenAI没有详细公布Sol、Terra、Luna三款模型之间的具体技术差异。Roboflow的测试至少提供了一个量化切口,让开发者可以从检测和计数两个场景判断Sol是否适合自身任务。

对于只需要图片问答的用户,计数和检测分数未必直接对应体验。但对需要接入视觉检测流水线的团队,这些指标比泛泛的图像描述更有参考价值。

不过,这批分数目前来自Roboflow自有基准。Roboflow在评测文章中提到,计划后续发布完整的VLM基准测试。待数据集、样本和评测方法公开后,外部开发者才能复核这些结果,并判断它与其他公开测试的差异。

发布评论
全部评论(0)