中文

AttentionHand: 基于文本驱动的可控手部图像生成用于野外 3D 手部重建

计算机视觉与模式识别 2024-07-26 v1 人工智能

摘要

最近,针对各种形式的人机交互进行 3D 手部重建研究取得了显著进展。然而,由于野外 3D 手部数据集极度不足,3D 手部在野外重建仍具有挑战性,尤其是当手部处于复杂姿势如交互手时,由于面部相似性、自手遮挡和深度歧义等问题,问题更加困难。为克服这些问题,我们提出了 AttentionHand,这是一种用于文本驱动可控手部图像生成的新方法。由于 AttentionHand 可以生成与 3D 手部标签良好对齐的各种各样和大量野外手部图像,我们可以获取新的 3D 手部数据集,并缓解室内外场景之间的领域差距。我们的方法需要易于使用的四种模态(即 RGB 图像、来自 3D 标签的手部网格图像、边界框和文本提示)。这些模态通过编码阶段嵌入到潜在空间中。然后,通过文本注意力阶段,对给定文本提示中的手部相关 token 进行注意力,突出显示潜在嵌入中与手部相关的区域。在突出显示的嵌入输入到视觉注意力阶段后,手部相关区域在嵌入中通过以给定手部网格图像为条件来进行全局和局部注意力。随后,在解码阶段,对最终特征进行解码以生成新的手部图像,这些图像与给定的手部网格图像和文本提示良好对齐。结果表明,AttentionHand 在文本到手部图像生成模型中实现了最先进的性能,并且通过额外使用 AttentionHand 生成的手部图像训练,提高了 3D 手部网格重建的性能。

关键词

引用

@article{arxiv.2407.18034,
  title  = {AttentionHand: Text-driven Controllable Hand Image Generation for 3D Hand Reconstruction in the Wild},
  author = {Junho Park and Kyeongbo Kong and Suk-Ju Kang},
  journal= {arXiv preprint arXiv:2407.18034},
  year   = {2024}
}

备注

Accepted by ECCV 2024