基于文本指令的自主角色-场景交互合成
计算机视觉与模式识别
2024-10-10 v2
摘要
在3D环境中合成人体运动,特别是那些包含复杂活动(如移动、手部伸展和人-物交互)的运动,对用户定义的路点和阶段转换提出了很高的要求。这些需求给当前模型带来了挑战,导致在根据简单的人类输入自动生成角色动画方面存在显著差距。本文通过引入一个综合框架来解决这一挑战,该框架可以直接从单个文本指令和目标位置合成多阶段场景感知交互运动。我们的方法采用自回归扩散模型来合成下一个运动片段,并采用一个自主调度器来预测每个动作阶段的转换。为了确保合成的运动与环境无缝集成,我们提出了一种场景表示,该表示考虑了起始位置和目标位置的局部感知。我们通过将帧嵌入与语言输入集成来进一步增强生成运动的连贯性。此外,为了支持模型训练,我们提供了一个全面的运动捕捉数据集,包含120个室内场景中16小时的运动序列,涵盖40种运动类型,每种运动都带有精确的语言描述。实验结果证明了我们的方法在生成与环境和文本条件紧密对齐的高质量多阶段运动方面的有效性。
引用
@article{arxiv.2410.03187,
title = {Autonomous Character-Scene Interaction Synthesis from Text Instruction},
author = {Nan Jiang and Zimo He and Zi Wang and Hongjie Li and Yixin Chen and Siyuan Huang and Yixin Zhu},
journal= {arXiv preprint arXiv:2410.03187},
year = {2024}
}