多模态模型视觉能力大考:为何顶尖选手也难及格?
近日,Kimi团队向研究社区开源了全新的多模态大模型视觉感知评测基准PerceptionBench。与以往综合性评测不同,这个基准的核心设计理念是将复杂的视觉感知能力“拆解”开来,像检查基本功一样进行单项考核。
评测什么:十项原子能力,剥离推理干扰
PerceptionBench没有设置需要复杂推理的复合场景题。它聚焦于十项视觉理解的原子级基础能力:
- 视觉关系:识别物体间的空间、动作等关系。
- 计数:准确数出图像中特定物体的数量。
- 属性识别:判断物体的颜色、形状、材质等。
- 深度与3D理解:感知场景的空间层次和立体信息。
- 定位:指出图像中特定元素的位置。
- 比较:对比两个或多个视觉元素的异同。
- 细粒度识别:区分同一大类下的细微差别(如不同犬种)。
- 上下文整合:结合图像整体场景理解局部信息。
- OCR:识别图像中的文字内容。
- 幻觉识别:检测模型是否“看到”了图中不存在的东西。
这3000道测试题全部来自现有42个评测集中模型曾答错的案例,并经过了人工验证,确保每道题只考察上述单一能力,排除了需要外部知识或多步逻辑推理的干扰。
结果如何:整体表现低迷,幻觉问题突出
基准对16款当前最前沿的多模态大模型进行了测试,结果有些出人意料:没有任何一个模型的整体准确率能够超过60%。这意味着,在最基础的视觉感知任务上,即使是最先进的模型,其表现也远未达到可靠的水平。
具体排名上,GPT-5.6-Sol以59.7%的准确率位列第一。紧随其后的是Kimi自家的K3模型(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)。头部模型之间的差距非常微小,形成了一个密集的“准60%”梯队。
报告特别指出,“视觉幻觉”是几乎所有模型表现最糟糕的环节。模型经常自信地描述出图像中并不存在的物体或细节,这一根本性问题严重制约了其在实际应用中的可信度。
启示与挑战:感知仍是“卡脖子”环节
PerceptionBench的发布和评测结果给火热的多模态研究泼了一盆“清醒的冷水”。它明确揭示,尽管模型在复杂的问答和推理任务上表现惊艳,但其底层视觉感知的基本功仍然非常不扎实。如果模型连“看到了什么”这个基本问题都频繁出错,那么在此基础上构建的任何高级理解和推理都像是沙上筑塔。
这一基准的开源,为整个领域提供了一个更精细的诊断工具。它促使研究者们重新审视模型训练的数据质量、架构设计以及评估方式,不再仅仅追求综合分数,而是要去攻克一个个具体的、原子级的感知短板。通往真正“眼明心亮”的多模态AI,路还很长。