中文

追踪并描述任何运动:无查询式视频中的运动发现与描述

计算机视觉与模式识别 2025-12-12 v1

摘要

我们提出Track and Caption Any Motion(TCAM),一个以运动为中心的框架,用于自动视频理解,通过无需用户查询的方式发现和描述运动模式。在挑战性场景(如遮挡、伪装或快速运动)中的视频理解往往更依赖于运动动力学而非静态外观。TCAM自主观察视频,识别多个运动活动,并通过运动场注意力机制将每个自然语言描述在空间上对其相应轨迹进行定位。我们的关键见解是,运动模式在与对比式视觉语言表示对齐时,可为识别和描述动作提供强大的语义信号。通过统一训练,将全局视频文本对齐与细粒度空间对应性结合,TCAM通过多头交叉注意力实现无查询式发现多个运动表达。在MeViS基准测试中,TCAM实现了58.4%的视频到文本检索率、64.9的空间定位平均F值(JF),并发现每个视频平均4.8个相关表达,准确率达84.7%,显示出强大的跨任务泛化能力。

关键词

引用

@article{arxiv.2512.10607,
  title  = {Track and Caption Any Motion: Query-Free Motion Discovery and Description in Videos},
  author = {Bishoy Galoaa and Sarah Ostadabbas},
  journal= {arXiv preprint arXiv:2512.10607},
  year   = {2025}
}