基于 Transformer 的端到端人体姿态与网格重建
计算机视觉与模式识别
2021-06-16 v3
摘要
我们提出一种称为 MEsh TRansfOrmer (METRO) 的新方法,从单张图像重建三维人体姿态和网格顶点。我们的方法使用 transformer 编码器联合建模顶点-顶点与顶点-关节交互,并同时输出三维关节坐标和网格顶点。与回归姿态和形状参数的现有技术不同,METRO 不依赖任何如 SMPL 之类的参数化网格模型,因此可轻松扩展到手等其他对象。我们进一步放宽网格拓扑,允许 transformer 自注意力机制在任何两个顶点间自由关注,从而能够学习网格顶点与关节间的非局部关系。借助提出的掩码顶点建模,我们的方法在处理部分遮挡等挑战性情形时更鲁棒且有效。METRO 在公开 Human3.6M 和 3DPW 数据集上取得了人体网格重建的新最优(state-of-the-art)结果。此外,我们展示了 METRO 对野外三维手部重建的泛化能力,在 FreiHAND 数据集上优于现有最优方法。代码与预训练模型见 https://github.com/microsoft/MeshTransformer。
引用
@article{arxiv.2012.09760,
title = {End-to-End Human Pose and Mesh Reconstruction with Transformers},
author = {Kevin Lin and Lijuan Wang and Zicheng Liu},
journal= {arXiv preprint arXiv:2012.09760},
year = {2021}
}
备注
CVPR 2021