多视角匹配 (MVM):利用动作冻结人体视频助力多人三维姿态估计学习
计算机视觉与模式识别
2020-04-14 v1
摘要
为解决从单张图像进行多人三维姿态估计这一挑战性问题,我们在本工作中提出一种多视角匹配 (MVM) 方法。MVM 方法从一个称为 Mannequin 数据集的大规模视频数据集中生成可靠的 3D 人体姿态,该数据集包含模仿人体模型的动作冻结人体。利用由 MVM 自动生成的 3D 监督所标注的大量野外视频数据,我们能够训练一个以单张图像为输入进行多人三维姿态估计的神经网络。MVM 的核心技术在于对具有强几何约束的静态场景多视角所获 2D 姿态的有效对齐。我们的目标是最大化多帧中估计的 2D 姿态的相互一致性,其中几何约束与外观相似性被同时考虑。为证明 MVM 方法所提供的 3D 监督的有效性,我们在 3DPW 与 MSCOCO 数据集上开展实验,并显示我们提出的方案提供了最先进的性能。
引用
@article{arxiv.2004.05275,
title = {Multi-View Matching (MVM): Facilitating Multi-Person 3D Pose Estimation Learning with Action-Frozen People Video},
author = {Yeji Shen and C. -C. Jay Kuo},
journal= {arXiv preprint arXiv:2004.05275},
year = {2020}
}
备注
16 pages, 6 figures, submitted JVCI