中文

OmniHands:通过通用Transformer实现鲁棒的4D手部网格恢复

计算机视觉与模式识别 2026-04-15 v4 人工智能 图形学

摘要

在本文中,我们介绍了OmniHands,一种从单目或多视角输入中恢复交互手部网格及其相对运动的通用方法。我们的方法解决了先前方法的两个主要局限性:缺乏处理各种手部图像输入的统一解决方案,以及忽略了图像中两只手的位置关系。为了克服这些挑战,我们开发了一种具有新颖标记化和上下文特征融合策略的通用架构,能够适应各种任务。具体来说,我们提出了一种关系感知双手标记化(RAT)方法,将位置关系信息嵌入到手部标记中。通过这种方式,我们的网络可以处理单手和双手输入,并显式利用相对手部位置,促进在真实世界场景中重建复杂的手部交互。由于这种标记化指示了两只手的相对关系,它也支持更有效的特征融合。为此,我们进一步开发了一个4D交互推理(FIR)模块,通过注意力机制在4D中融合手部标记,并将它们解码为3D手部网格和相对时间运动。我们方法的有效性在多个基准数据集上得到了验证。在野外视频和真实世界场景上的结果表明,我们的方法在交互手部重建方面具有优越的性能。更多视频结果可以在项目页面找到:https://OmniHand.github.io。

关键词

引用

@article{arxiv.2405.20330,
  title  = {OmniHands: Towards Robust 4D Hand Mesh Recovery via A Versatile Transformer},
  author = {Dixuan Lin and Yuxiang Zhang and Mengcheng Li and Wei Jing and Qi Yan and Qianying Wang and Yebin Liu and Hongwen Zhang},
  journal= {arXiv preprint arXiv:2405.20330},
  year   = {2026}
}

备注

An extended journal version of 4DHands, featured with versatile module that can adapt to temporal task and multi-view task. Additional detailed comparison experiments and results presentation have been added. More demo videos can be seen at our project page: https://OmniHand.github.io