ReMoRa:基于精细化运动表示的多模态长视频理解大语言模型
计算机视觉与模式识别
2026-02-24 v2
摘要
尽管多模态大语言模型(MLLM)在广泛的任务中展现出显著的成功,但长视频理解仍是一个重要挑战。本研究聚焦于 MLLM 进行视频理解。这一任务具有挑战性,因为处理完整的 RGB 帧序列在计算上不可行且高度冗余,因为自注意力机制的时间复杂度随序列长度呈二次增长。在本文中,我们提出了 ReMoRa,一种直接处理视频压缩表示的视频 MLLM。模型保留一小部分 RGB 关键帧用于表象信息,同时将时间动态编码为运动表示,从而无需依据顺序的 RGB 帧。这些运动表示充当光流的紧凑代理,捕捉时间动态而无需完整解码帧。为细化基于块的运动表示的噪声和低保真度,我们引入一个模块用于去噪和生成细粒度运动表示。此外,我们的模型以序列长度的线性比例压缩这些特征。我们通过在广泛的长视频理解基准测试中进行大量实验,展示了 ReMoRa 的有效性。ReMoRa 在包括 LongVideoBench、NExT-QA 和 MLVU 在内的多个具有挑战性的基准测试中超越了基线方法。
引用
@article{arxiv.2602.16412,
title = {ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding},
author = {Daichi Yashima and Shuhei Kurita and Yusuke Oda and Komei Sugiura},
journal= {arXiv preprint arXiv:2602.16412},
year = {2026}
}
备注
Accepted to CVPR 2026