中文

DICE:从单张图像 end-to-end 捕捉手部-面部相互作用中的变形

计算机视觉与模式识别 2025-03-17 v2

摘要

从单张图像重建带变形的手部-面部相互作用3D模型是一个具有广泛应用(如 AR、VR 和游戏)的挑战性且关键的任务。该任务的挑战源于单视角手部-面部相互作用中的自遮挡、手部与面部之间复杂的空间关系、复杂的变形以及单视角设置下的歧义性。唯一已知的方法 Decaf 引入了由联系和变形估计网络(基于具有3D标注的工作室收集数据)驱动的全局拟合优化。然而,Decaf 因依赖手部-面部交互数据的3D标注而存在耗时的优化过程和有限的泛化能力。为解决这些问题,我们提出了 DICE(Deformation-aware hand-face Interaction reCovEry from a single image),这是一种从单张图像进行变形感知手部-面部相互作用恢复的首个端到端方法。DICE 使用基于 Transformer 的架构同时估计手部和面部的姿态、联系和变形。其特点是将局部变形场和全局网格顶点位置的回归解耦为两个网络分支,从而增强变形和联系估计,以实现精确且稳健的手部-面部网格恢复。为提高泛化性,我们提出了一种弱监督训练方法,通过使用无3D真实标注的野外图像扩充训练集,采用来自 off-the-shelf 模型估计的2D关键点深度和基于对抗性先验的姿态进行监督。我们的实验表明,DICE 在标准基准和野外数据上的准确性和物理合理性均达到最先进水平。此外,我们的方法可在 Nvidia 4090 GPU 上以交互式速度(20 fps)运行,而 Decaf 需要超过 15 秒才能处理单张图像。我们的代码将在发表后公开。

关键词

引用

@article{arxiv.2406.17988,
  title  = {DICE: End-to-end Deformation Capture of Hand-Face Interactions from a Single Image},
  author = {Qingxuan Wu and Zhiyang Dou and Sirui Xu and Soshi Shimada and Chen Wang and Zhengming Yu and Yuan Liu and Cheng Lin and Zeyu Cao and Taku Komura and Vladislav Golyanik and Christian Theobalt and Wenping Wang and Lingjie Liu},
  journal= {arXiv preprint arXiv:2406.17988},
  year   = {2025}
}

备注

ICLR 2025