中文

FALCON:通过视觉寄存器解决高分辨率多模态大语言模型中的视觉冗余与碎片化问题

计算机视觉与模式识别 2025-07-01 v2

摘要

将高分辨率视觉输入融入多模态大语言模型(MLLMs)中,能够增强其在实际任务中的视觉感知能力。然而,大多数现有的高分辨率MLLMs依赖裁剪式方法处理图像,导致视觉编码碎片化以及冗余token的激增。为解决此问题,我们提出FALCON模型。FALCON引入新颖的视觉寄存器技术,同时实现:1)在视觉编码阶段消除冗余token。为直接解决视觉编码输出中存在的冗余问题,我们提出基于寄存器的表示压缩机制(Register-based Representation Compacting, ReCompact)。该机制引入一组可学习的视觉寄存器,用于自适应聚合关键信息并丢弃冗余信息,从而使编码器产生更紧凑的视觉表征,无需额外的压缩模块。2)确保视觉编码的连续性。为解决因视觉输入碎片化导致的潜在编码错误,我们开发了基于寄存器的交互注意力模块(Register Interactive Attention, ReAtten)。该模块通过启用视觉寄存器之间的交互,促进跨子图像的有效且高效的信息交换,确保视觉语义在编码过程中的连续性。我们在高分辨率基准测试上进行了全面的实验评估。FALCON在显著减少90%视觉token数量的同时,展现出卓越的性能。

关键词

引用

@article{arxiv.2501.16297,
  title  = {FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers},
  author = {Renshan Zhang and Rui Shao and Gongwei Chen and Miao Zhang and Kaiwen Zhou and Weili Guan and Liqiang Nie},
  journal= {arXiv preprint arXiv:2501.16297},
  year   = {2025}
}

备注

Accepted to the IEEE/CVF International Conference on Computer Vision (ICCV) 2025