XFormer:基于单目图像的快速精准三维人体捕捉
计算机视觉与模式识别
2023-05-19 v1
摘要
我们提出XFormer,一种新颖的人体网格与运动捕捉方法,其在仅以单目图像为输入时,可在消费级CPU上实现实时性能。所提出的网络架构包含两条分支:一个关键点分支,基于2D关键点估计三维人体网格顶点;以及一个图像分支,直接从RGB图像特征进行预测。我们方法的核心是一个跨模态transformer模块,其通过建模2D关键点坐标与图像空间特征之间的注意力,使信息能够在这两条分支间流动。我们的架构经过巧妙设计,使我们能够在各类数据集上训练,包括带有2D/3D标注的图像、带有3D伪标签的图像,以及无关联图像的动捕数据集。这有效提升了系统的精度与泛化能力。基于轻量骨干网络(MobileNetV3),我们的方法运行极快(单CPU核心上超过30fps)且仍具 competitive 精度。此外,采用HRNet骨干时,XFormer在Human3.6与3DPW数据集上取得了最先进的性能。
引用
@article{arxiv.2305.11101,
title = {XFormer: Fast and Accurate Monocular 3D Body Capture},
author = {Lihui Qian and Xintong Han and Faqiang Wang and Hongyu Liu and Haoye Dong and Zhiwen Li and Huawei Wei and Zhe Lin and Cheng-Bin Jin},
journal= {arXiv preprint arXiv:2305.11101},
year = {2023}
}