CoMemo:大型视觉语言模型需要图像上下文与图像记忆
计算机视觉与模式识别
2025-06-09 v1
摘要
近期大型视觉语言模型(LVLMs)基于大型语言模型的进展,已将视觉特征与语言模型表示进行对齐,成为主导范式。然而,继承自语言模型的架构设计在多模态处理方面引入了次优特征。首先,LVLMs 在注意力分配上呈现双峰分布,导致随着上下文扩大,中间视觉内容被逐渐忽略。其次,常规位置编码方案在处理动态高分辨率图像时,无法保留关键二维结构关系。为此,我们提出了 CoMemo —— 一种包含上下文图像路径和图像记忆路径的双路径架构,用于视觉处理,有效缓解视觉信息被忽略的问题。此外,我们引入了 RoPE-DHR 一种新型位置编码机制,通过缩略图-based 位置聚合,维持二维空间感知,同时缓解长序列中的远程衰减。我们在包括长上下文理解、多图像推理和视觉问答等七个基准测试上进行评估,结果表明 CoMemo 在各种传统 LVLM 架构中表现出优越性能。项目页面可在 https://lalbj.github.io/projects/CoMemo/ 查看。
引用
@article{arxiv.2506.06279,
title = {CoMemo: LVLMs Need Image Context with Image Memory},
author = {Shi Liu and Weijie Su and Xizhou Zhu and Wenhai Wang and Jifeng Dai},
journal= {arXiv preprint arXiv:2506.06279},
year = {2025}
}
备注
ICML 2025