中文

基于单目事件相机的双交互手 3D 姿态估计

计算机视觉与模式识别 2023-12-22 v1

摘要

由于手部交互、遮挡、左右手歧义以及快速运动,从单目视频进行 3D 手部跟踪是一个非常具有挑战性的问题。大多数现有方法依赖于 RGB 输入,这在低光照条件下存在严重限制,并且容易受到运动模糊的影响。相比之下,事件相机捕捉局部亮度变化而非完整图像帧,因此不会受到上述效应的影响。不幸的是,由于数据模态的显著差异,现有的基于图像的技术无法直接应用于事件数据。针对这些挑战,本文介绍了首个从单个单目事件相机跟踪两个快速移动且相互作用的手的 3D 框架。我们的方法通过一种新颖的半监督特征级注意力机制来解决左右手歧义问题,并集成了交叉损失以修正手部碰撞。为了促进该研究领域的进展,我们发布了一个新的大规模合成数据集 Ev2Hands-S(包含两个相互作用的手),以及一个新的真实基准 Ev2Hands-R(包含真实事件流和真值 3D 标注)。我们的方法在 3D 重建精度方面优于现有方法,并能泛化到严重光照条件下的真实数据。

关键词

引用

@article{arxiv.2312.14157,
  title  = {3D Pose Estimation of Two Interacting Hands from a Monocular Event Camera},
  author = {Christen Millerdurai and Diogo Luvizon and Viktor Rudnev and André Jonas and Jiayi Wang and Christian Theobalt and Vladislav Golyanik},
  journal= {arXiv preprint arXiv:2312.14157},
  year   = {2023}
}

备注

17 pages, 12 figures, 7 tables; project page: https://4dqv.mpi-inf.mpg.de/Ev2Hands/