中文

ReMoRa:基于精细化运动表示的多模态长视频理解大语言模型

计算机视觉与模式识别 2026-02-24 v2

摘要

尽管多模态大语言模型(MLLM)在广泛的任务中展现出显著的成功,但长视频理解仍是一个重要挑战。本研究聚焦于 MLLM 进行视频理解。这一任务具有挑战性,因为处理完整的 RGB 帧序列在计算上不可行且高度冗余,因为自注意力机制的时间复杂度随序列长度呈二次增长。在本文中,我们提出了 ReMoRa,一种直接处理视频压缩表示的视频 MLLM。模型保留一小部分 RGB 关键帧用于表象信息,同时将时间动态编码为运动表示,从而无需依据顺序的 RGB 帧。这些运动表示充当光流的紧凑代理,捕捉时间动态而无需完整解码帧。为细化基于块的运动表示的噪声和低保真度,我们引入一个模块用于去噪和生成细粒度运动表示。此外,我们的模型以序列长度的线性比例压缩这些特征。我们通过在广泛的长视频理解基准测试中进行大量实验,展示了 ReMoRa 的有效性。ReMoRa 在包括 LongVideoBench、NExT-QA 和 MLVU 在内的多个具有挑战性的基准测试中超越了基线方法。

关键词

引用

@article{arxiv.2602.16412,
  title  = {ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding},
  author = {Daichi Yashima and Shuhei Kurita and Yusuke Oda and Komei Sugiura},
  journal= {arXiv preprint arXiv:2602.16412},
  year   = {2026}
}

备注

Accepted to CVPR 2026