中文

基于文本描述的接触感知人体运动生成

计算机视觉与模式识别 2024-09-17 v2 人工智能

摘要

本文解决了从文本生成三维交互式人体运动的问题。给定描述不同身体部位与静态物体接触动作的文本描述,我们合成视觉上自然且物理上合理的3D身体姿态序列。然而,由于运动和文本描述中均未充分考虑物理接触的交互,导致生成不自然且不合理的序列,这一任务面临重大挑战。为应对这一挑战,我们创建了一个名为RICH-CAT的新数据集,代表从RICH数据集构建的“接触感知文本”。RICH-CAT包含高质量运动、精确的人-物接触标签以及详细的文本描述,涵盖26种室内/室外动作的超过8500个运动-文本对。利用RICH-CAT,我们提出了一种名为CATMO的新方法,用于文本驱动的交互式人体运动合成,该方法明确地将人体接触作为证据整合进来。我们采用两个VQ-VAE模型将运动和身体接触序列编码到不同但互补的潜在空间中,并使用一个交织的GPT以相互条件的方式生成人体运动和接触。此外,我们引入了一个预训练的文本编码器来学习能够更好区分不同接触类型的文本嵌入,从而对合成运动和接触进行更精确的控制。实验表明,与现有文本到运动方法相比,我们的方法性能优越,能够生成稳定、接触感知的运动序列。代码和数据将在https://xymsh.github.io/RICH-CAT/上提供用于研究目的。

关键词

引用

@article{arxiv.2403.15709,
  title  = {Contact-aware Human Motion Generation from Textual Descriptions},
  author = {Sihan Ma and Qiong Cao and Jing Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2403.15709},
  year   = {2024}
}

备注

Project page: https://xymsh.github.io/RICH-CAT/