根据文本描述在3D场景中生成人体运动
计算机视觉与模式识别
2024-05-14 v1
摘要
根据文本描述生成人体运动因其广泛的应用而获得了越来越多的研究兴趣。然而,只有少数工作同时考虑了人-场景交互和文本条件,这对于视觉和物理真实性至关重要。本文聚焦于根据人-场景交互的文本描述,在3D室内场景中生成人体运动的任务。由于文本、场景和运动的多模态性质,以及空间推理的需求,该任务具有挑战性。为了解决这些挑战,我们提出了一种新方法,将复杂问题分解为两个更易于管理的子问题:(1) 目标对象的语言定位和 (2) 以对象为中心的运动生成。对于目标对象的语言定位,我们利用了大型语言模型的能力。对于运动生成,我们设计了一种以对象为中心的场景表示,使生成模型专注于目标对象,从而降低场景复杂性并促进对人体运动与对象之间关系的建模。实验证明了我们的方法相比基线具有更好的运动质量,并验证了我们的设计选择。
引用
@article{arxiv.2405.07784,
title = {Generating Human Motion in 3D Scenes from Text Descriptions},
author = {Zhi Cen and Huaijin Pi and Sida Peng and Zehong Shen and Minghui Yang and Shuai Zhu and Hujun Bao and Xiaowei Zhou},
journal= {arXiv preprint arXiv:2405.07784},
year = {2024}
}
备注
Project page: https://zju3dv.github.io/text_scene_motion