中文

CoMemo:大型视觉语言模型需要图像上下文与图像记忆

计算机视觉与模式识别 2025-06-09 v1

摘要

近期大型视觉语言模型(LVLMs)基于大型语言模型的进展,已将视觉特征与语言模型表示进行对齐,成为主导范式。然而,继承自语言模型的架构设计在多模态处理方面引入了次优特征。首先,LVLMs 在注意力分配上呈现双峰分布,导致随着上下文扩大,中间视觉内容被逐渐忽略。其次,常规位置编码方案在处理动态高分辨率图像时,无法保留关键二维结构关系。为此,我们提出了 CoMemo —— 一种包含上下文图像路径和图像记忆路径的双路径架构,用于视觉处理,有效缓解视觉信息被忽略的问题。此外,我们引入了 RoPE-DHR 一种新型位置编码机制,通过缩略图-based 位置聚合,维持二维空间感知,同时缓解长序列中的远程衰减。我们在包括长上下文理解、多图像推理和视觉问答等七个基准测试上进行评估,结果表明 CoMemo 在各种传统 LVLM 架构中表现出优越性能。项目页面可在 https://lalbj.github.io/projects/CoMemo/ 查看。

关键词

引用

@article{arxiv.2506.06279,
  title  = {CoMemo: LVLMs Need Image Context with Image Memory},
  author = {Shi Liu and Weijie Su and Xizhou Zhu and Wenhai Wang and Jifeng Dai},
  journal= {arXiv preprint arXiv:2506.06279},
  year   = {2025}
}

备注

ICML 2025