iMOVE: 面向实例-运动感知的视频理解
计算机视觉与模式识别
2025-02-19 v2
摘要
提升视频大型语言模型(Video LLM)在细粒度实例时空运动感知能力对于提高其时序和通用视频理解至关重要。然而,当前模型在感知详细且复杂的实例运动方面存在挑战。为此,本文从数据和模型两个方面进行改进。就数据而言,我们精心策划了首个大规模实例-运动感知视频指令调优数据集iMOVE-IT。该数据集丰富了全面的实例运动标注和时空互监督任务,为模型的实例-运动感知提供了广泛训练。在此基础上,我们引入iMOVE,一个实例-运动感知的视频基础模型,该模型利用事件感知时空高效建模以保留有价值的实例时空运动细节,同时保持计算效率。它还包含相对时空位置标记,以确保对实例时空位置的感知。评估表明,iMOVE不仅在视频时序理解和通用视频理解方面表现优异,而且在长期视频理解方面显示出显著优势。
引用
@article{arxiv.2502.11594,
title = {iMOVE: Instance-Motion-Aware Video Understanding},
author = {Jiaze Li and Yaya Shi and Zongyang Ma and Haoran Xu and Feng Cheng and Huihui Xiao and Ruiwen Kang and Fan Yang and Tingting Gao and Di Zhang},
journal= {arXiv preprint arXiv:2502.11594},
year = {2025}
}