通过自我头部姿态估计实现自我中心身体姿态估计
计算机视觉与模式识别
2023-08-29 v3 图形学
摘要
从自我中心视频序列估计3D人体运动对于人类行为理解至关重要,并在VR/AR中有多种应用。然而,朴素地学习自我中心视频与人体运动之间的映射具有挑战性,因为用户的身体常被放置在用户头部的朝前摄像头所不可见。此外,收集具有配对的自我中心视频和3D人体运动的大规模高质量数据集需要精确的运动捕捉设备,这往往将视频中的场景多样性限制在类实验室环境中。为消除对配对自我中心视频与人体运动的需求,我们提出了一种新方法,即通过自我头部姿态估计实现自我中心身体姿态估计(EgoEgo),该方法将问题分解为两个阶段,以头部运动作为中间表示相连接。EgoEgo首先集成SLAM与学习方法以估计精确的头部运动。随后,利用估计的头部姿态作为输入,EgoEgo采用条件扩散生成多个合理的全身运动。这种头部与身体姿态的解耦消除了对具有配对自我中心视频和3D人体运动训练数据集的需求,使我们能够分别利用大规模的自我中心视频数据集和运动捕捉数据集。此外,为系统性基准测试,我们开发了一个合成数据集AMASS-Replica-Ego-Syn(ARES),包含配对的自我中心视频与人体运动。在ARES和真实数据上,我们的EgoEgo模型均显著优于当前最先进的方法。
引用
@article{arxiv.2212.04636,
title = {Ego-Body Pose Estimation via Ego-Head Pose Estimation},
author = {Jiaman Li and C. Karen Liu and Jiajun Wu},
journal= {arXiv preprint arXiv:2212.04636},
year = {2023}
}
备注
CVPR 2023 (Award Candidate)