揭示 LVLMs 对基本视觉变化的鲁棒性不足:原因及未来之路
计算机视觉与模式识别
2025-06-03 v3 人工智能
摘要
大型视觉语言模型(LVLMs)在 various vision-language 任务中表现出色,但其对自然场景中因视点和环境变化导致的对象位置、尺度、方向和上下文等视觉变化的鲁棒性仍基本未被探索。为弥合这一差距,我们引入 VR-Bench,一个用于评估 LVLMs 视觉变化鲁棒性的综合基准框架,包含自动化的数据集生成和原则化指标。通过对 21 个 LVLMs 的广泛评估,我们发现这些模型对视觉变化极其脆弱,即使是在复杂视觉语言任务中表现卓越的模型在简单任务(如对象识别)上也显著表现不足。这些模型表现出独特的视觉位置偏差,这与有效感受野理论相矛盾,并且展现出类似人类的视觉视野阈值。为识别这些脆弱性的来源,我们提出了一种用于组件级分析的系统框架,特别是一种用于对齐视觉特征的新型可视化方法。结果表明,这些脆弱性源于管道架构中的误差累积和不充分的多模态对齐。补充实验表明,这些限制是根本性的架构缺陷,要求在未来的 LVLM 设计中进行架构创新。
引用
@article{arxiv.2504.16727,
title = {Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward},
author = {Zhiyuan Fan and Yumeng Wang and Sandeep Polisetty and Yi R. Fung},
journal= {arXiv preprint arXiv:2504.16727},
year = {2025}
}
备注
Accepted to ACL 2025 Findings