中文

单目 RGB 图像中的 3D 手部网格恢复(相机空间)

计算机视觉与模式识别 2024-05-14 v1

摘要

随着虚拟现实、增强现实和手势控制等技术的快速发展,用户期望与计算机界面进行更自然、直观的交互。现有的视觉算法往往难以完成高级的人机交互任务,迫切需要准确可靠的绝对空间预测方法。此外,处理单目图像中的复杂场景和遮挡问题提出了全新的挑战。本研究提出了一种网络模型,实现对根相对网格和根恢复任务的并行处理。该模型能够从单目 RGB 图像中恢复相机空间中的 3D 手部网格。为便于端到端训练,我们采用隐式学习方法生成 2D 热图,增强不同子任务中 2D 线索的兼容性。将 Inception 概念引入谱图卷积网络以探索根的相对网格,并将其与为根恢复设计的局部细节和全局注意力方法集成。这种方法提高了模型在复杂环境和自遮挡场景中的预测性能。通过在大规模手部数据集 FreiHAND 上的评估,我们证明了所提出模型与最先进模型相当。本研究推动了在各种人机交互应用中实现准确可靠绝对空间预测技术的发展。

关键词

引用

@article{arxiv.2405.07167,
  title  = {3D Hand Mesh Recovery from Monocular RGB in Camera Space},
  author = {Haonan Li and Patrick P. K. Chen and Yitong Zhou},
  journal= {arXiv preprint arXiv:2405.07167},
  year   = {2024}
}

备注

21 pages, 7 figures