WHAM:以精确3D运动重建全局坐标系下的人体
计算机视觉与模式识别
2024-04-22 v2
摘要
从视频估计3D人体运动已取得快速进展,但当前方法仍存在几个关键局限。首先,大多数方法在相机坐标系中估计人体。其次,先前关于全局坐标系下人体估计的工作通常假设平坦地面并产生脚滑。第三,最精确的方法依赖于计算昂贵的优化流程,限制了其离线应用。最后,现有的基于视频的方法精度反而低于单帧方法。我们通过WHAM(World-grounded Humans with Accurate Motion)解决了这些局限,该方法从视频中准确高效地重建全局坐标系下的3D人体运动。WHAM学习使用动作捕捉数据将2D关键点序列提升到3D,并将其与视频特征融合,整合运动上下文和视觉信息。WHAM利用从SLAM方法估计的相机角速度以及人体运动来估计身体的全局轨迹。我们将其与接触感知轨迹细化方法相结合,使WHAM能够在多种条件下(如爬楼梯)捕捉人体运动。WHAM在多个野外基准测试中优于所有现有的3D人体运动恢复方法。代码将在http://wham.is.tue.mpg.de/供研究使用。
引用
@article{arxiv.2312.07531,
title = {WHAM: Reconstructing World-grounded Humans with Accurate 3D Motion},
author = {Soyong Shin and Juyong Kim and Eni Halilaj and Michael J. Black},
journal= {arXiv preprint arXiv:2312.07531},
year = {2024}
}