中文

MotionBank:具有解耦规则化标注的大规模视频运动基准

计算机视觉与模式识别 2024-10-18 v1

摘要

在本文中,我们解决了如何构建和基准测试大型运动模型(LMM)的问题。LMM 的最终目标是作为多功能运动相关任务(例如,人体运动生成)的基础模型,具有可解释性和泛化性。尽管先进,但最近的 LMM 相关工作仍然受到小规模运动数据和昂贵文本描述的限制。此外,先前的运动基准主要关注纯身体运动,忽略了上下文中的普遍运动,即人与人、人与物体以及人与场景的交互。为了解决这些限制,我们整合了大规模视频动作数据集作为知识库来构建 MotionBank,其中包含 13 个视频动作数据集、124 万个运动序列和 1.329 亿帧自然且多样化的人体运动。与实验室捕获的运动不同,野外以人为中心的视频包含丰富的上下文运动。为了促进更好的运动-文本对齐,我们还精心设计了一个运动字幕生成算法,通过每个运动的运动学特征自动生成基于规则的、无偏的和解耦的文本描述。大量实验表明,我们的 MotionBank 对于人体运动生成、上下文运动生成和运动理解等通用运动相关任务是有益的。视频运动连同基于规则的文本注释可以作为更大 LMM 的有效替代方案。我们的数据集、代码和基准将在 https://github.com/liangxuy/MotionBank 公开提供。

关键词

引用

@article{arxiv.2410.13790,
  title  = {MotionBank: A Large-scale Video Motion Benchmark with Disentangled Rule-based Annotations},
  author = {Liang Xu and Shaoyang Hua and Zili Lin and Yifan Liu and Feipeng Ma and Yichao Yan and Xin Jin and Xiaokang Yang and Wenjun Zeng},
  journal= {arXiv preprint arXiv:2410.13790},
  year   = {2024}
}