TopoPerception:大型视觉语言模型全局视觉感知的无捷径评估
人工智能
2025-11-18 v1 计算机视觉与模式识别
机器学习
摘要
大型视觉语言模型(LVLMs)通常将来自编码器的视觉特征与预训练的大型语言模型(LLM)对齐。这使得视觉感知模块成为瓶颈,从而限制了 LVLMs 的整体能力。虽然丰富的视觉语义基准测试在视觉语义方面很丰富,但常常包含不可避免的局部捷径,这可能导致对模型感知能力的高估。为了解决这一问题,我们引入 TopoPerception,一种利用拓扑性质对 LVLMs 在各种细粒度水平上进行全局视觉感知能力的严格评估基准。由于拓扑性质依赖于图像的全局结构且对局部特征不变,TopoPerception 能够进行无捷径的全局感知评估,从根本上区别于语义丰富的任务。我们对顶尖模型在 TopoPerception 上进行评估,发现即使在最粗糙的感知细粒度上,所有模型的表现也不如随机猜测,这表明它们在感知全局视觉特征方面存在显著的能力缺陷。值得注意的是,在模型家族中出现了一致的趋势:具有更强推理能力的更强大的模型表现更差。这表明仅靠扩大模型规模并不足以解决这一问题,甚至可能加剧这一问题。需要新的训练范式或体系结构才能取得进展。TopoPerception 不仅揭示了当前 LVLMs 中的关键瓶颈,也为改进其全局视觉感知提供了视角和方向。该数据和代码已公开可用:https://github.com/Wenhao-Zhou/TopoPerception。
引用
@article{arxiv.2511.11831,
title = {TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models},
author = {Wenhao Zhou and Hao Zheng and Rong Zhao},
journal= {arXiv preprint arXiv:2511.11831},
year = {2025}
}