中文

TokenHMR:以 Token 化姿态表示推进人体网格恢复

计算机视觉与模式识别 2024-04-26 v1

摘要

我们解决了从单张图像回归 3D 人体姿态和形状的问题,重点关注 3D 精度。当前最佳方法利用了 3D 伪真值 (p-GT) 和 2D 关键点的大型数据集,从而实现了鲁棒的性能。在这些方法中,我们观察到一个矛盾的现象:随着 2D 精度的提高,3D 姿态精度反而下降。这是由 p-GT 中的偏差以及近似相机投影模型的使用所导致的。我们量化了当前相机模型引入的误差,并表明精确拟合 2D 关键点和 p-GT 会导致错误的 3D 姿态。我们的分析界定了无效距离,在该距离内最小化 2D 和 p-GT 损失是有害的。我们利用这一点提出了一种新损失——阈值自适应损失缩放 (TALS),该损失对较大的 2D 和 p-GT 损失进行惩罚,但不惩罚较小的损失。使用这种损失,会有许多 3D 姿态能同样解释 2D 证据。为了减少这种模糊性,我们需要一个关于有效人体姿态的先验,但此类先验可能会引入不需要的偏差。为了解决这个问题,我们利用了人体姿态的 Token 化表示,并将问题重新表述为 Token 预测。这将估计姿态限制在有效姿态空间内,从而有效地提供了均匀的先验。在 EMDB 和 3DPW 数据集上的大量实验表明,我们重新表述的关键点损失和 Token 化使我们能够在野外数据上进行训练,同时提高了相对于现有 SOTA 的 3D 精度。我们的模型和代码已开放用于研究,网址:https://tokenhmr.is.tue.mpg.de。

关键词

引用

@article{arxiv.2404.16752,
  title  = {TokenHMR: Advancing Human Mesh Recovery with a Tokenized Pose Representation},
  author = {Sai Kumar Dwivedi and Yu Sun and Priyanka Patel and Yao Feng and Michael J. Black},
  journal= {arXiv preprint arXiv:2404.16752},
  year   = {2024}
}

备注

CVPR 2024