中文

MaskHand:用于非受限环境下鲁棒手部网格重建的生成式掩码建模

计算机视觉与模式识别 2025-03-20 v2 人工智能 机器学习

摘要

由于复杂的关节运动、自遮挡和深度模糊性,从单张 RGB 图像重建 3D 手部网格具有挑战性。传统的判别式方法学习从 2D 图像到单一 3D 网格的确定性映射,通常难以处理 2D 到 3D 映射中固有的模糊性。为应对这一挑战,我们提出了 MaskHand,一种用于手部网格恢复的新型生成式掩码模型,它通过学习并从模糊的 2D 到 3D 映射过程的概率分布中进行采样,以合成合理的 3D 手部网格。MaskHand 包含两个关键组件:(1) VQ-MANO,将 3D 手部关节运动编码为潜在空间中的离散姿态 token;(2) Context-Guided Masked Transformer,随机掩码部分姿态 token 并在受损 token 序列、图像上下文和 2D 姿态线索的条件下学习它们的联合分布。学习到的分布促进了推理过程中的置信度引导采样,从而产生低不确定性和高精度的网格重建。在基准数据集和真实世界数据集上的广泛评估表明,MaskHand 在 3D 手部网格重建中实现了 SOTA 的准确度、鲁棒性和真实感。项目网站:https://m-usamasaleem.github.io/publication/MaskHand/MaskHand.html。

关键词

引用

@article{arxiv.2412.13393,
  title  = {MaskHand: Generative Masked Modeling for Robust Hand Mesh Reconstruction in the Wild},
  author = {Muhammad Usama Saleem and Ekkasit Pinyoanuntapong and Mayur Jagdishbhai Patel and Hongfei Xue and Ahmed Helmy and Srijan Das and Pu Wang},
  journal= {arXiv preprint arXiv:2412.13393},
  year   = {2025}
}