从单个 RGB 相机学习重建着衣人体
计算机视觉与模式识别
2019-04-09 v2
摘要
我们提出一种基于学习的模型,用于从单目视频的少量帧(1-8 帧,人物处于运动中)推断人物的个性化 3D 形状,耗时少于 10 秒,重建精度达 5mm。我们的模型学习预测统计身体模型的参数和实例位移,后者为形状添加衣物和头发。该模型基于两个关键设计选择实现快速且准确的预测。首先,通过在规范 T 姿态空间预测形状,网络学会将人物图像编码为姿态不变的潜在编码,并在其中融合信息。其次,基于前馈预测快速但不总与输入图像对齐的观察,我们使用自底向上和自顶向下双流(每视图一个)进行预测,使信息可双向流动。学习仅依赖合成 3D 数据。一旦学习完成,模型可接受可变帧数作为输入,甚至能从单张图像以 6mm 的精度重建形状。在 3 个不同数据集上的结果证明了我们方法的有效性与准确性。
引用
@article{arxiv.1903.05885,
title = {Learning to Reconstruct People in Clothing from a Single RGB Camera},
author = {Thiemo Alldieck and Marcus Magnor and Bharat Lal Bhatnagar and Christian Theobalt and Gerard Pons-Moll},
journal= {arXiv preprint arXiv:1903.05885},
year = {2019}
}