VirtualPose:从虚拟数据学习可泛化的三维人体姿态模型
计算机视觉与模式识别
2022-07-21 v1
摘要
尽管单目三维姿态估计在公开数据集上似乎已取得非常精确的结果,但其泛化能力却被严重忽视。在本工作中,我们对现有方法进行了系统评估,发现当在不同相机、人体姿态和外观上测试时,它们的误差明显增大。为解决该问题,我们提出 VirtualPose,一种两阶段学习框架,以利用该任务特有的隐藏“免费午餐”,即以零成本生成无限数量的姿态和相机用于训练模型。为此,第一阶段将图像转换为抽象几何表示(AGR),随后第二阶段将其映射到三维姿态。它从两方面解决泛化问题:(1)第一阶段可在多样化二维数据集上训练,以降低对有限外观过拟合的风险;(2)第二阶段可在由大量虚拟相机和姿态合成的多样化 AGR 上训练。该方法在不使用来自基准的任何配对图像与三维姿态的情况下优于 SOTA 方法,为实际应用铺平了道路。代码见 https://github.com/wkom/VirtualPose。
引用
@article{arxiv.2207.09949,
title = {VirtualPose: Learning Generalizable 3D Human Pose Models from Virtual Data},
author = {Jiajun Su and Chunyu Wang and Xiaoxuan Ma and Wenjun Zeng and Yizhou Wang},
journal= {arXiv preprint arXiv:2207.09949},
year = {2022}
}