中文

基于掩码自编码器的视觉遮挡感知 3D 手-物体姿态估计

计算机视觉与模式识别 2025-06-13 v1

摘要

由于手-物体相互作用中存在的严重遮挡,单目 RGB 图像上的手-物体姿态估计仍然是一个重要挑战。现有方法不足地探索全局结构感知与推理,限制了其在处理遮挡手-物体相互作用方面的有效性。为此,我们提出一种基于掩码自编码器的遮挡感知手-物体姿态估计方法,称为 HOMAE。具体而言,我们提出了一种以目标为导向的掩码策略,对手-物体交互区域施加结构化遮挡,鼓励模型学习具上下文感知的特征并推理遮挡结构。我们进一步将来自解码器的多尺度特征整合,以预测有符号距离场 (SDF),以捕获全局上下文和细粒度几何信息。为增强几何感知,我们将隐式 SDF 与从 SDF 派生的显式点云相结合,利用两者的互补优势。这一融合使我们能够通过结合 SDF 提供的全局上下文与点云提供的精确局部几何,更稳健地处理遮挡区域。在挑战性的 DexYCB 和 HO3Dv2 数据集上进行的大量实验表明,HOMAE 在手-物体姿态估计方面实现了状态-of-the-art 性能。我们将发布代码和模型。

关键词

引用

@article{arxiv.2506.10816,
  title  = {Occlusion-Aware 3D Hand-Object Pose Estimation with Masked AutoEncoders},
  author = {Hui Yang and Wei Sun and Jian Liu and Jin Zheng and Jian Xiao and Ajmal Mian},
  journal= {arXiv preprint arXiv:2506.10816},
  year   = {2025}
}

备注

10 pages, 6 figures