中文

言语为主导,动作为可能:基于场景 affordance 的语言引导人体运动生成

计算机视觉与模式识别 2024-03-28 v1

摘要

尽管文本到运动合成取得了显著进展,但在3D环境中生成语言引导的人体运动仍面临重大挑战。这些挑战主要源于:(i)缺乏能够联合建模自然语言、3D场景和人体运动的强大生成模型,以及(ii)生成模型对大量数据需求与综合性高质量、语言-场景-运动数据集稀缺的矛盾。为解决这些问题,我们引入一种新型双阶段框架,采用场景 affordance 作为中间表示,有效连接3D场景定位与条件运动生成。我们的框架包括用于预测显式 affordance 图的场景 affordance 模型(ADM),以及用于生成合理人体运动的场景-运动扩散模型(AMDM)。通过利用场景 affordance 图,我们的方法克服了在多模态条件信号下生成人体运动的困难,尤其是在缺乏大量语言-场景-运动配对数据的有限数据下。我们的 extensive 实验表明,该方法在 established benchmark 数据集(包括 HumanML3D 和 HUMANISE)上 consistently 优于所有 baseline。此外,我们验证了模型在额外构建的评估集上的卓越泛化能力,该评估集包含未见过的描述和场景。

关键词

引用

@article{arxiv.2403.18036,
  title  = {Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance},
  author = {Zan Wang and Yixin Chen and Baoxiong Jia and Puhao Li and Jinlu Zhang and Jingze Zhang and Tengyu Liu and Yixin Zhu and Wei Liang and Siyuan Huang},
  journal= {arXiv preprint arXiv:2403.18036},
  year   = {2024}
}

备注

CVPR 2024; 16 pages