用于从 2D 关键点高效估计人体网格的 MoCap 到视觉域适应
计算机视觉与模式识别
2024-04-11 v1
摘要
本文提出了 Key2Mesh,这是一种以一组 2D 人体姿态关键点为输入并估计相应身体网格的模型。由于此过程不涉及任何视觉(即 RGB 图像)数据,该模型可在大规模动作捕捉(MoCap)数据集上进行训练,从而克服了带有 3D 标签的图像数据集的稀缺性。为了使该模型能够应用于 RGB 图像,我们首先运行现成的 2D 姿态估计器以获取 2D 关键点,然后将这些 2D 关键点输入至 Key2Mesh。为了提高我们的模型在 RGB 图像上的性能,我们应用了对抗域适应(DA)方法来弥合 MoCap 与视觉域之间的差距。至关重要的是,我们的 DA 方法不需要视觉数据的 3D 标签,这使得无需昂贵的标签即可适应目标数据集。我们在不存在 RGB 与网格标签对的情况下,评估了 Key2Mesh 从 2D 关键点估计 3D 人体网格的任务。我们在广泛使用的 H3.6M 和 3DPW 数据集上的结果表明,Key2Mesh 在两个数据集的 PA-MPJPE 以及 3DPW 数据集的 MPJPE 和 PVE 上均优于其他模型,创造了新的 SOTA。得益于我们模型简单的架构,其运行速度至少比先前的 SOTA 模型 LGD 快 12 倍。更多定性样本和代码可在项目网站获取:https://key2mesh.github.io/。
引用
@article{arxiv.2404.07094,
title = {MoCap-to-Visual Domain Adaptation for Efficient Human Mesh Estimation from 2D Keypoints},
author = {Bedirhan Uguz and Ozhan Suat and Batuhan Karagoz and Emre Akbas},
journal= {arXiv preprint arXiv:2404.07094},
year = {2024}
}
备注
accepted to CVPRW 2024