HueManity:探究多模态大语言模型的细粒度视觉感知能力
计算机视觉与模式识别
2026-02-03 v5 人工智能
机器学习
摘要
近期多模态大语言模型(MLLMs)在视觉问答和图像描述等任务中展现了强大的高层视觉推理能力。然而,现有的基准测试在很大程度上忽略了它们捕捉细粒度感知细节的能力。随着MLLMs越来越多地部署在安全性和可靠性至关重要的场景中,感知敏锐度变得不可或缺。我们提出了HueManity,一个用于评估MLLMs细粒度视觉感知的可扩展自动化基准测试。HueManity包含83,850张嵌入字母数字字符串的石原式图像,旨在评估模式识别这一视觉理解的核心方面。我们对九个最先进的MLLMs的评估揭示了显著的性能缺陷:在简单的数字任务上,最强模型仅达到33.6%的准确率,而在更难的字母数字任务上仅为3%,相比之下,人类(99.38%,93.25%)和微调的ResNet-50(96.5%,94.5%)的表现接近上限。这些发现暴露了MLLMs感知基础中的一个关键弱点,该弱点被强调高层语义的传统基准测试所掩盖。
引用
@article{arxiv.2506.03194,
title = {HueManity: Probing Fine-Grained Visual Perception in MLLMs},
author = {Rynaa Grover and Jayant Sravan Tamarapalli and Sahiti Yerramilli and Nilay Pande},
journal= {arXiv preprint arXiv:2506.03194},
year = {2026}
}