VisMem:潜在视觉记忆解锁视觉语言模型的潜能
计算机视觉与模式识别
2026-02-06 v2 人工智能
机器学习
摘要
尽管视觉语言模型(Vision-Language Models, VLMs)取得了显著的成功,但在诸多复杂视觉任务上的性能常常受到“视觉处理瓶颈”的制约:即在持续生成过程中,模型容易丢失对视觉证据的 grounding,表现出对情境化视觉经验的不足。灵感来自人类认知记忆理论,该理论区分了短期视觉主导记忆和长期语义主导记忆。我们提出 VisMem 框架,为 VLMs 引入动态潜在视觉记忆,包括用于细粒度感知保持的短期模块和用于抽象语义巩固的长期模块。这些记忆在推理期间被无缝调用,使 VLMs 能够在思考与生成之间保持感知保真度和语义一致性。广泛的实验在多样化的视觉基准(理解、推理和生成)上表明,VisMem 相较于基础模型实现了约 11.0% 的显著性能提升,并超越所有对手方案,确立了潜在空间记忆增强的新范式。代码将公开:https://github.com/YU-deep/VisMem.git。
引用
@article{arxiv.2511.11007,
title = {VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models},
author = {Xinlei Yu and Chengming Xu and Guibin Zhang and Zhangquan Chen and Yudong Zhang and Yongbo He and Peng-Tao Jiang and Jiangning Zhang and Xiaobin Hu and Shuicheng Yan},
journal= {arXiv preprint arXiv:2511.11007},
year = {2026}
}