中文

MPT:基于 Transformer 的网格预训练用于人体姿态与网格重建

计算机视觉与模式识别 2023-03-17 v2

摘要

从单张图像重建三维人体姿态与网格的传统方法依赖于成对的图像-网格数据集,这类数据集往往难以获取且成本高昂。受此限制,模型的可扩展性与重建性能均受到制约。为应对这一挑战,我们提出网格预训练(Mesh Pre-Training, MPT),一种利用大量动作捕捉(MoCap)数据在大规模上有效执行预训练的策略。我们引入使用 MoCap 生成的热图作为网格回归 Transformer 的输入表示,并提出掩码热图建模(Masked Heatmap Modeling)方法以提升预训练性能。本研究表明,使用所提 MPT 进行预训练可使我们的模型在无需微调的情况下进行有效推理。我们进一步表明,对预训练的 MPT 模型进行微调可显著提升从单张图像进行人体网格重建的精度。实验结果表明,MPT 在 Human3.6M 与 3DPW 数据集上优于以往最先进(state-of-the-art, SOTA)方法。作为进一步应用,我们在三维手部重建任务上对 MPT 进行了基准测试与研究,表明我们的通用预训练方案能很好地泛化到手部姿态估计并取得有前景的重建性能。

关键词

引用

@article{arxiv.2211.13357,
  title  = {MPT: Mesh Pre-Training with Transformers for Human Pose and Mesh Reconstruction},
  author = {Kevin Lin and Chung-Ching Lin and Lin Liang and Zicheng Liu and Lijuan Wang},
  journal= {arXiv preprint arXiv:2211.13357},
  year   = {2023}
}