中文

DogMo:用于 4D 犬类运动恢复的大规模多视角 RGB-D 数据集

计算机视觉与模式识别 2025-10-29 v1

摘要

我们提出 DogMo,一个大规模多视角 RGB-D 视频数据集,捕获多样化犬类运动,用于从图像恢复运动。DogMo 包含 1.2k 运动序列,来自 10 只独特犬只,提供运动和品种的丰富变异。它解决了现有犬类运动数据集的关键局限性,包括缺乏多视角和真实 3D 数据,以及规模和多样性有限。利用 DogMo,我们建立了四个运动恢复基准设置,支持从单视角到多视角、从 RGB 到 RGB-D 输入的系统化评估。为实现准确运动恢复,我们进一步引入一个三阶段、实例特定的优化管道,用于拟合 SMAL 模型至运动序列。该方法通过粗对齐、稠密对应监督和时间正则化逐步细化身体形状和姿态。我们的数据集和方法为推动犬类运动恢复研究提供了原则性基础,并在计算机视觉、计算机图形和动物行为建模的交叉领域开辟了新方向。

关键词

引用

@article{arxiv.2510.24117,
  title  = {DogMo: A Large-Scale Multi-View RGB-D Dataset for 4D Canine Motion Recovery},
  author = {Zan Wang and Siyu Chen and Luya Mo and Xinfeng Gao and Yuxin Shen and Lebin Ding and Wei Liang},
  journal= {arXiv preprint arXiv:2510.24117},
  year   = {2025}
}

备注

19 pages