中文

HERO:重新思考高分辨率大型视觉语言模型中视觉令牌的早期丢弃

计算机视觉与模式识别 2025-09-30 v2

摘要

通过将高分辨率图像裁剪为局部图块并独立编码,高分辨率大型视觉语言模型(HR-LVLMs)已在细粒度视觉理解方面显示出显著能力。然而,这种分而治之范式显著增加了视觉令牌的数量,导致计算和内存开销巨大。为更好地理解和解决这一挑战,我们经验性地研究了HR-LVLMs中的视觉令牌利用情况,发现了三个关键发现:(1)局部图块的重要性各不相同,由视觉显著性和任务相关性共同决定;(2)CLIP基视觉编码器中的CLS令牌在各层中显示出两阶段注意力模式,每一阶段注意不同类型的视觉令牌;(3)不同阶段强调的视觉令牌在信息粒度水平上具有不同编码,发挥互补作用于LVLMs中。基于这些洞见,我们提出HERO—a High-resolution visual token early dropping框架,集成内容自适应令牌预算分配与功能感知令牌选择。通过准确估计图块级别的重要性并有选择地保留具有互补作用的视觉令牌,HERO在多样化基准和模型规模上实现了优越的效率-精度权衡,全部以无训练方式实现。该研究为HR-LVLMs的高效推理提供了实证洞见和实用解决方案。

关键词

引用

@article{arxiv.2509.13067,
  title  = {HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models},
  author = {Xu Li and Yuxuan Liang and Xiaolei Chen and Yi Zheng and Haotian Chen and Bin Li and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2509.13067},
  year   = {2025}
}