DynImg:基于关键帧和视觉提示的多模态视频理解表示方法
计算机视觉与模式识别
2025-07-22 v1
摘要
近年来,多模态大型语言模型(MLLMs)向视频理解任务的引入变得日益普遍。然而,如何有效地整合时间信息仍是关键研究焦点。传统方法将空间信息和时间信息分别处理。由于运动模糊等问题,难以准确地表示快速移动物体的空间信息。这可能导致在空间特征提取过程中,对时间上重要的区域被低估,从而阻碍了准确的时空相互作用和视频理解。为此,我们提出一种创新的视频表示方法,称为 Dynamic-Image(DynImg)。具体而言,我们引入一组非关键帧作为时间提示,以突出包含快速移动物体的空间区域。在视觉特征提取过程中,这些提示引导模型对这些区域对应的细粒度空间特征给予额外注意。此外,为保持 DynImg 的正确序列,我们采用相应的 4D 视频旋转位置嵌入(4D video Rotary Position Embedding),以保留 DynImg 的时空相邻性,帮助 MLLM 理解该组合格式中的时空顺序。实验评估表明,DynImg 在多个视频理解基准测试中约提升 2%,证明了这些时间提示在增强视频理解方面的有效性。
引用
@article{arxiv.2507.15569,
title = {DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding},
author = {Xiaoyi Bao and Chenwei Xie and Hao Tang and Tingyu Weng and Xiaofeng Wang and Yun Zheng and Xingang Wang},
journal= {arXiv preprint arXiv:2507.15569},
year = {2025}
}
备注
Accepted by ICCV 2025