中文

PostoMETRO:面向鲁棒三维人体网格恢复的姿态令牌增强网格Transformer

计算机视觉与模式识别 2024-03-20 v1

摘要

随着基于单张图像的人体网格恢复近期取得进展,在保持整体模型精度的同时,增强其在遮挡等特定极端场景下的性能引起了越来越多的兴趣。尽管获取遮挡下精确标注的三维人体姿态具有挑战性,但仍存在大量丰富且精确的二维姿态标注可供利用。然而,现有工作大多侧重于直接利用二维姿态坐标来估计三维姿态和网格。在本文中,我们提出了PostoMETRO(Pos\textbf{Pos}e to\textbf{to}ken enhanced ME\textbf{ME}sh TR\textbf{TR}ansfO\textbf{O}rmer),它以逐令牌的方式将抗遮挡的二维姿态表示集成到Transformer中。利用专门的姿态分词器,我们高效地将二维姿态数据压缩为紧凑的姿态令牌序列,并将其与图像令牌一起馈送到Transformer。这一过程不仅确保了来自图像的丰富纹理描述,还促进了姿态与图像信息的鲁棒整合。随后,这些组合令牌被顶点和关节令牌查询,以解码网格顶点和人体关节的三维坐标。借助鲁棒的姿态令牌表示和有效的组合,即使在遮挡等极端场景下,我们也能生成更精确的三维坐标。在标准和遮挡特定基准上的实验证明了PostoMETRO的有效性。定性结果进一步说明了二维姿态如何帮助三维重建的清晰性。代码将公开。

关键词

引用

@article{arxiv.2403.12473,
  title  = {PostoMETRO: Pose Token Enhanced Mesh Transformer for Robust 3D Human Mesh Recovery},
  author = {Wendi Yang and Zihang Jiang and Shang Zhao and S. Kevin Zhou},
  journal= {arXiv preprint arXiv:2403.12473},
  year   = {2024}
}