利用 MoCap 数据进行人体网格恢复
计算机视觉与模式识别
2021-10-19 v1
摘要
训练用于从图像或视频中恢复人体姿态和形状的最先进模型需要带有相应标注的数据集,而这些标注非常难以获取且成本高昂。本文的目标是研究来自 3D 动作捕捉(MoCap)数据的姿态是否可用于改进基于图像和基于视频的人体网格恢复方法。我们发现,使用 MoCap 数据的合成渲染对基于图像的模型进行微调,可以通过为它们提供更多样化的姿态、纹理和背景来提高其性能。事实上,我们表明,仅微调模型的批量归一化层就足以获得大幅提升。我们进一步研究了 MoCap 数据在视频中的应用,并引入了 PoseBERT,这是一个直接回归姿态参数并通过掩码建模进行训练的 transformer 模块。它简单、通用,可以插入在任何最先进的基于图像的模型之上,以利用时间信息将其转换为基于视频的模型。我们的实验结果表明,所提出的方法在包括 3DPW、MPI-INF-3DHP、MuPoTS-3D、MCB 和 AIST 在内的多个数据集上达到了最先进的性能。测试代码和模型将很快提供。
引用
@article{arxiv.2110.09243,
title = {Leveraging MoCap Data for Human Mesh Recovery},
author = {Fabien Baradel and Thibault Groueix and Philippe Weinzaepfel and Romain Brégier and Yannis Kalantidis and Grégory Rogez},
journal= {arXiv preprint arXiv:2110.09243},
year = {2021}
}
备注
3DV 2021