中文

运动定地视频推理:在像素级理解和感知运动

计算机视觉与模式识别 2025-04-07 v2 人工智能

摘要

本文提出运动定地视频推理,这是一种新的运动理解任务,要求根据输入问题生成视觉答案(视频分割掩码),因此需要隐式的时空推理和定地。该任务通过引入基于问题的隐式推理,将现有专注于显式动作/运动定地的时空定地工作扩展到更一般的形式。为促进新任务的发展,我们收集了一个名为GROUNDMORE的大规模数据集,包含1,715个视频片段、249K个物体掩码,这些掩码专门设计了4种问题类型(因果、顺序、反事实和描述),用于基准测试深度和全面的运动推理能力。GROUNDMORE独特地要求模型生成视觉答案,提供比纯文本更具体、更直观可解释的响应。它在时空定地和推理两方面评估模型,有助于解决与运动相关的视频推理、时间感知和像素级理解中的复杂挑战。此外,我们提出了一种名为运动定地视频推理助手(MORA)的新基线模型。MORA融合了多模态大语言模型的多模态推理能力、定地模型(SAM)的像素级感知能力以及轻量级定位头的时间感知能力。MORA在GROUNDMORE上取得了可观的性能,相对超越现有最佳视觉定地基线模型平均21.5%。我们希望这一新颖且具有挑战性的任务将为通过视频推理分割实现鲁棒和通用的运动理解铺平道路。

关键词

引用

@article{arxiv.2411.09921,
  title  = {Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level},
  author = {Andong Deng and Tongjia Chen and Shoubin Yu and Taojiannan Yang and Lincoln Spencer and Yapeng Tian and Ajmal Saeed Mian and Mohit Bansal and Chen Chen},
  journal= {arXiv preprint arXiv:2411.09921},
  year   = {2025}
}

备注

CVPR 2025