MotionSight: 增强多模态 LLM 中的细粒度运动理解
计算机视觉与模式识别
2025-10-10 v2
摘要
尽管多模态大型语言模型(MLLMs)取得了进展,但其在细粒度视频运动理解方面的能力仍然严重受限。它们通常缺乏帧间差分能力,并倾向于平均化或忽略微妙的视觉线索。此外,尽管视觉提示在静态图像中展现出潜力,但其在视频时间复杂性中的应用,特别是对于细粒度运动理解,很大程度上仍未被探索。我们研究了固有能力是否可以被解锁并提升 MLLMs 的运动感知,以及是否能够实现量身定制的独特视觉特征,以解耦物体和相机运动线索。在本研究中,我们引入了 MotionSight,这是一种新颖的零样本方法,开创性地将以物体为中心的视觉聚光灯和运动模糊作为视觉提示,以有效提高细粒度运动理解而无需训练。为了将其转化为有价值的数据资产,我们精心整理了 MotionVid-QA,这是首个用于细粒度视频运动理解的大规模数据集,包含 SFT 和偏好数据等分层注释、{\Theta}(40K) 个视频片段和 {\Theta}(87K) 个问答。实验表明,MotionSight 实现了 state-of-the-art 的开源性能,并与商业模型具有竞争力。特别是对于细粒度运动理解,我们提出了一种新颖的零样本技术和一个大规模、高质量的数据集。所有代码和注释将公开发布。
引用
@article{arxiv.2506.01674,
title = {MotionSight: Boosting Fine-Grained Motion Understanding in Multimodal LLMs},
author = {Yipeng Du and Tiehan Fan and Kepan Nan and Rui Xie and Penghao Zhou and Xiang Li and Jian Yang and Zhenheng Yang and Ying Tai},
journal= {arXiv preprint arXiv:2506.01674},
year = {2025}
}