记住我:通过三步仅推理衰减弹性策略弥合LVLM中的长程依赖鸿沟
计算机视觉与模式识别
2025-11-14 v1
摘要
大型视觉语言模型(LVLM)在广泛的多模态任务中取得了令人瞩目的性能。然而,在使用旋转位置编码(ROPE)时,它们在建模长程依赖方面仍然面临关键挑战。尽管ROPE有助于精确建模标记位置,但它会导致随着标记距离增加而出现的渐进式注意力衰减,特别是对于远距离标记对,这会严重损害模型记忆全局上下文的能力。为了缓解这个问题,我们提出了仅推理的**三步衰减弹性策略(T-DRS)**,包括:(1) **语义驱动衰减弹性策略(SD-DRS)**,通过内容感知残差放大语义重要但距离远的信号;(2) **距离感知控制衰减弹性策略(DC-DRS)**,通过基于位置距离平滑调制权重来净化注意力,抑制噪声同时保持局部性;(3) **重新强化远距离衰减弹性策略(reRD-DRS)**,巩固剩余的信息性远程依赖以维持全局一致性。T-DRS共同恢复了被抑制的长程标记对,而不损害局部归纳偏置。在视觉问答(VQA)基准上的大量实验表明,T-DRS能够以无需训练的方式持续提升性能。代码可在 https://github.com/labixiaoq-qq/Remember-me 获取。
引用
@article{arxiv.2511.09868,
title = {Remember Me: Bridging the Long-Range Gap in LVLMs with Three-Step Inference-Only Decay Resilience Strategies},
author = {Peng Gao and Yujian Lee and Xiaofeng Zhang and Zailong Chen and Hui Zhang},
journal= {arXiv preprint arXiv:2511.09868},
year = {2025}
}
备注
Accepted in AAAI 2026