中文

原型性偏差揭示多模态评估指标中的盲点

计算机视觉与模式识别 2026-01-13 v2 人工智能

摘要

自动指标现在对于评估文生图模型至关重要,通常在基准测试和大规模筛选中替代人类判断。然而,目前尚不清楚这些指标是否真正优先考虑语义正确性,还是反而偏向于从有偏差的数据分布中学习到的视觉和社会原型图像。我们识别并研究了原型性偏差作为多模态评估中的一种系统性失效模式。我们引入了一个受控对比基准ProtoBias(原型性偏差),涵盖动物、物体和人口统计图像,其中语义正确但非原型的图像与细微错误但原型的对抗性对应图像配对。这种设置能够定向评估指标是遵循文本语义还是默认使用原型。我们的结果表明,广泛使用的指标,包括CLIPScore、PickScore和基于VQA的分数,经常对这些配对进行错误排序,而即使是LLM-as-Judge系统在社会基础案例中也表现出不均匀的鲁棒性。人类评估始终偏好具有更大决策余量的语义正确性。受这些发现启发,我们提出了ProtoScore,一个鲁棒的7B参数指标,它大幅降低了失败率并抑制了错误排序,同时运行速度比GPT-5的推理时间快数个数量级,接近更大规模闭源评判器的鲁棒性。

关键词

引用

@article{arxiv.2601.04946,
  title  = {Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics},
  author = {Subhadeep Roy and Gagan Bhatia and Steffen Eger},
  journal= {arXiv preprint arXiv:2601.04946},
  year   = {2026}
}

备注

First version