中文

通过概率逐像素部位分割学习解歧强交互双手

计算机视觉与模式识别 2021-11-30 v2

摘要

在自然对话与交互中,我们的双手经常相互重叠或接触。由于手部外观的同质性,这使得从图像中估计交互双手的三维姿态变得困难。本文表明,自相似性以及由此产生的将像素观测分配给各自手部及其部位的歧义,是最终三维姿态误差的主要成因。受此启发,我们提出 DIGIT,一种从单目图像估计两只交互手三维姿态的新方法。该方法由两条交织的分支组成,将输入图像处理为逐像素语义部位分割掩码和视觉特征体。与先前工作不同,我们并未将分割与姿态估计阶段解耦,而是直接在下游姿态估计任务中利用逐像素概率。为此,部位概率与视觉特征融合,并通过全卷积层处理。我们通过实验表明,所提方法在 InterHand2.6M 数据集上达到了新的最先进性能。我们提供了详细的消融研究,以证明方法的有效性,并深入揭示像素归属建模如何影响三维手部姿态估计。

关键词

引用

@article{arxiv.2107.00434,
  title  = {Learning to Disambiguate Strongly Interacting Hands via Probabilistic Per-pixel Part Segmentation},
  author = {Zicong Fan and Adrian Spurr and Muhammed Kocabas and Siyu Tang and Michael J. Black and Otmar Hilliges},
  journal= {arXiv preprint arXiv:2107.00434},
  year   = {2021}
}