中文

BEDLAM2.0:动作中的合成人类与相机

计算机视觉与模式识别 2025-11-19 v1

摘要

从视频中推断三维人体运动仍是一个具有多种应用场景的挑战问题。虽然传统方法在图像坐标系中估计人体,但许多应用需要估计以世界坐标系表示的人体运动。当人体与相机同时运动时,这尤其具有挑战性。本领域的进展受限于缺乏带有人体与相机运动真实值的丰富视频数据。我们通过 BEDLAM2.0 数据集来解决这一问题,该数据集在重要方面超越了流行的 BEDLAM 数据集。在除引入更具多样性和现实感的相机及相机运动外,BEDLAM2.0 还增加了身体形态、运动、服装、发型和三维环境的多样性与真实感。此外,还添加了鞋子,这在 BEDLAM 中缺失。BEDLAM 已成为训练三维人体姿态与运动 regressor 的关键资源,我们表明 BEDLAM2.0 在各方面都显著更好,特别是对于训练估计世界坐标系中人体的方法。我们比较了在 BEDLAM 与 BEDLAM2.0 上训练的前沿方法,发现 BEDLAM2.0 在准确性上显著优于 BEDLAM。为便于研究,我们提供渲染视频、ground truth 身体参数以及相机运动。我们也提供我们拥有权利的 3D 资产以及来自第三方的链接。

关键词

引用

@article{arxiv.2511.14394,
  title  = {BEDLAM2.0: Synthetic Humans and Cameras in Motion},
  author = {Joachim Tesch and Giorgio Becherini and Prerana Achar and Anastasios Yiannakidis and Muhammed Kocabas and Priyanka Patel and Michael J. Black},
  journal= {arXiv preprint arXiv:2511.14394},
  year   = {2025}
}

备注

NeurIPS 2025 (Datasets and Benchmarks track, oral). Project website: https://bedlam2.is.tue.mpg.de