跨层视觉平滑:通过持续关注关键对象增强大型视觉语言模型的视觉理解
计算机视觉与模式识别
2025-11-26 v2 人工智能
摘要
大型视觉语言模型(LVLMs)能够准确定位图像中的关键对象,但它们对这些对象的注意力往往非常短暂。基于持续关注关键对象可以提升 LVLMs 视觉能力的假设,我们提出了跨层视觉平滑(CLVS)。CLVS 的核心思想是引入一个视觉记忆,用于平滑跨层的注意力分布。具体来说,我们在第一层用位置无偏的视觉注意力初始化这个视觉记忆。在后续层中,模型的视觉注意力会联合考虑来自先前层的视觉记忆,同时该记忆会迭代更新,从而保持对关键对象的平滑注意力。鉴于视觉理解主要发生在模型的早期和中间层,我们使用不确定性作为视觉理解完成的指标,并据此终止平滑过程。在三个 LVLMs 的四个基准上的实验证实了我们方法的有效性和泛化性。CLVS 在多种视觉理解任务上取得了最先进的整体性能,并在图像描述基准上取得了与领先方法相当的结果。
引用
@article{arxiv.2509.12897,
title = {Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models},
author = {Jianfei Zhao and Feng Zhang and Xin Sun and Chong Feng and Zhixing Tan},
journal= {arXiv preprint arXiv:2509.12897},
year = {2025}
}
备注
Under Review