中文

用于第一人称视角 3D 手部姿态估计的单目到双视图适配

计算机视觉与模式识别 2024-03-12 v2

摘要

追求精确的 3D 手部姿态估计是第一人称视觉领域理解人类活动的基石。大多数现有的估计方法仍依赖单视图图像作为输入,导致潜在的局限性,例如视野受限和深度模糊。为解决这些问题,增加另一个摄像头以更好地捕捉手部形状是一个实际的方向。然而,现有的多视图手部姿态估计方法存在两个主要缺点:1) 训练需要多视图标注,成本高昂。2) 在测试期间,如果摄像头参数/布局与训练中使用的不同,模型将变得不适用。在本文中,我们提出了一种新颖的单目到双视图适配 (S2DHand) 解决方案,将预训练的单视图估计器适配到双视图。与现有的多视图训练方法相比,1) 我们的适配过程是无监督的,消除了对多视图标注的需求。2) 此外,我们的方法可以处理具有未知摄像头参数的任意双视图对,使模型适用于多样的摄像头设置。具体而言,S2DHand 建立在特定的立体约束之上,包括成对的跨视图一致性和两视图间变换的不变性。这两个立体约束以互补方式使用以生成伪标签,从而实现可靠的适配。评估结果表明,S2DHand 在数据集内和数据集间设置下的任意摄像头对上均取得了显著改进,并以领先的性能优于现有的适配方法。项目页面:https://github.com/MickeyLLG/S2DHand。

关键词

引用

@article{arxiv.2403.04381,
  title  = {Single-to-Dual-View Adaptation for Egocentric 3D Hand Pose Estimation},
  author = {Ruicong Liu and Takehiko Ohkawa and Mingfang Zhang and Yoichi Sato},
  journal= {arXiv preprint arXiv:2403.04381},
  year   = {2024}
}

备注

This paper is accepted by CVPR2024. Code will be released at https://github.com/ut-vision/S2DHand