言语为主导,动作为可能:基于场景 affordance 的语言引导人体运动生成
计算机视觉与模式识别
2024-03-28 v1
摘要
尽管文本到运动合成取得了显著进展,但在3D环境中生成语言引导的人体运动仍面临重大挑战。这些挑战主要源于:(i)缺乏能够联合建模自然语言、3D场景和人体运动的强大生成模型,以及(ii)生成模型对大量数据需求与综合性高质量、语言-场景-运动数据集稀缺的矛盾。为解决这些问题,我们引入一种新型双阶段框架,采用场景 affordance 作为中间表示,有效连接3D场景定位与条件运动生成。我们的框架包括用于预测显式 affordance 图的场景 affordance 模型(ADM),以及用于生成合理人体运动的场景-运动扩散模型(AMDM)。通过利用场景 affordance 图,我们的方法克服了在多模态条件信号下生成人体运动的困难,尤其是在缺乏大量语言-场景-运动配对数据的有限数据下。我们的 extensive 实验表明,该方法在 established benchmark 数据集(包括 HumanML3D 和 HUMANISE)上 consistently 优于所有 baseline。此外,我们验证了模型在额外构建的评估集上的卓越泛化能力,该评估集包含未见过的描述和场景。
引用
@article{arxiv.2403.18036,
title = {Move as You Say, Interact as You Can: Language-guided Human Motion Generation with Scene Affordance},
author = {Zan Wang and Yixin Chen and Baoxiong Jia and Puhao Li and Jinlu Zhang and Jingze Zhang and Tengyu Liu and Yixin Zhu and Wei Liang and Siyuan Huang},
journal= {arXiv preprint arXiv:2403.18036},
year = {2024}
}
备注
CVPR 2024; 16 pages