通过玩游戏实现三维人体重建
计算机视觉与模式识别
2024-09-11 v3
摘要
基于图像和视频的三维人体重建(即姿态和形状估计)已取得实质性进展。然而,由于运动捕捉的高昂成本,现有数据集在规模和多样性上往往受限。在这项工作中,我们通过玩具有自动标注三维真值的视频游戏来获取海量人体序列。具体而言,我们贡献了 GTA-Human,一个使用 GTA-V 游戏引擎生成的大规模三维人体数据集,具有高度多样化的主体、动作和场景。更重要的是,我们研究了游戏数据的使用并获得了五个主要发现。第一,游戏数据出奇地有效。在 GTA-Human 上训练的简单逐帧基线方法大幅优于更复杂的方法。对于基于视频的方法,GTA-Human 甚至与域内训练集效果相当。第二,我们发现合成数据为通常在室内采集的真实数据提供了关键的补充。我们对领域差距的研究为简单而有效的数据混合策略提供了解释。第三,数据集的规模至关重要。性能提升与可用的额外数据密切相关。一项系统研究从多个关键方面揭示了模型对数据密度的敏感性。第四,GTA-Human 的有效性也归功于丰富的强监督标签(SMPL 参数),而这些标签在真实数据集中获取成本高昂。第五,合成数据的益处扩展到更大的模型,例如更深的卷积神经网络(CNN)和 Transformer,在这些模型上也观察到了显著的影响。我们希望我们的工作能为将三维人体重建扩展到真实世界铺平道路。主页:https://caizhongang.github.io/projects/GTA-Human/
引用
@article{arxiv.2110.07588,
title = {Playing for 3D Human Recovery},
author = {Zhongang Cai and Mingyuan Zhang and Jiawei Ren and Chen Wei and Daxuan Ren and Zhengyu Lin and Haiyu Zhao and Lei Yang and Chen Change Loy and Ziwei Liu},
journal= {arXiv preprint arXiv:2110.07588},
year = {2024}
}
备注
Homepage: https://caizhongang.github.io/projects/GTA-Human/