中文

BOTH2Hands:从文本提示与身体动态推断3D手部动作

计算机视觉与模式识别 2024-09-27 v5

摘要

近期兴起的文本到动作生成技术激发了大量便捷且交互式人体运动生成的尝试。然而,现有方法大多局限于仅生成身体运动,而未考虑丰富的双手运动,更不用说处理身体动态或文本等多种条件。为打破数据瓶颈,我们提出了BOTH57M,一个用于双手运动生成的新型多模态数据集。该数据集包含对人体和手部的精确运动跟踪,并提供成对的指级手部标注和身体描述。我们进一步为一项新任务——从隐式身体动态和显式文本提示生成生动的双手运动——提供了一个强大的基线方法BOTH2Hands。我们首先预热两个并行的身体到手和文本到手扩散模型,然后利用交叉注意力Transformer进行运动融合。大量实验和交叉验证证明了我们的方法和数据集在从混合身体与文本条件生成令人信服的双手运动方面的有效性。我们的数据集和代码将向社区发布,以供未来研究使用。

关键词

引用

@article{arxiv.2312.07937,
  title  = {BOTH2Hands: Inferring 3D Hands from Both Text Prompts and Body Dynamics},
  author = {Wenqian Zhang and Molin Huang and Yuxuan Zhou and Juze Zhang and Jingyi Yu and Jingya Wang and Lan Xu},
  journal= {arXiv preprint arXiv:2312.07937},
  year   = {2024}
}

备注

Accepted to CVPR 2024