中文

LLaVA-MLB:缓解并利用免训练视频 LLM 中的注意力偏差

计算机视觉与模式识别 2025-03-17 v1

摘要

免训练视频大语言模型利用预训练的图像 LLM 来处理视频内容,而无需进一步训练。此类方法的一个关键挑战在于,受限于图像 LLM 的 token 限制,难以保留必要的视觉和时间信息。为解决此问题,我们提出了一种基于 LLM 注意力分数选择与查询相关 token 的两阶段方法:先压缩视频序列,随后扩展序列。然而,在压缩阶段,图像 LLM 在视频序列中常表现出位置注意力偏差,即注意力过度集中在较晚的帧上,导致早期帧信息未被充分利用。为缓解序列压缩中的这种注意力偏差,我们提出了网格化注意力池化以保留时空结构。此外,我们引入了视觉摘要尾部以有效利用该偏差,促进序列扩展期间的整体视频理解。通过这种方式,我们的方法有效地缓解并利用了注意力偏差,使冻结的图像 LLM 能够进行细致的视频理解。在多个基准上的实验表明,我们的方法优于现有方法,在效率和准确性上均取得了更优的性能。我们的代码将予以发布。

关键词

引用

@article{arxiv.2503.11205,
  title  = {LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs},
  author = {Leqi Shen and Tao He and Guoqiang Gong and Fan Yang and Yifeng Zhang and Pengzhang Liu and Sicheng Zhao and Guiguang Ding},
  journal= {arXiv preprint arXiv:2503.11205},
  year   = {2025}
}