中文

TSTMotion:基于训练-free的场景感知文本到运动生成

计算机视觉与模式识别 2025-05-06 v2 人工智能

摘要

文本到运动生成最近受到广泛关注,主要聚焦于在空白背景上生成人类动作序列。然而,人类运动常见于多样化3D场景中,这促使探索场景感知文本到运动生成方法。然而,现有的场景感知方法常依赖于大规模真实的运动序列数据,而这些数据在多样化3D场景中获取成本高昂。为此,我们首次提出一种 \textbf{T}raining-free \textbf{S}cene-aware \textbf{T}ext-to-\textbf{M}otion 框架,称为 \textbf{TSTMotion},有效地赋予预训练的空白背景运动生成器场景感知能力。具体而言,基于给定的3D场景和文本描述,我们采用基础模型进行推理、预测和验证,以获得场景感知运动指导。然后,将运动指导纳入空白背景运动生成器,通过两种修改手段,实现场景感知文本驱动的运动序列。广泛的实验表明,我们提出的框架具有有效性和通用性。我们在\href{https://tstmotion.github.io/}{项目页面}上发布了代码。

关键词

引用

@article{arxiv.2505.01182,
  title  = {TSTMotion: Training-free Scene-aware Text-to-motion Generation},
  author = {Ziyan Guo and Haoxuan Qu and Hossein Rahmani and Dewen Soh and Ping Hu and Qiuhong Ke and Jun Liu},
  journal= {arXiv preprint arXiv:2505.01182},
  year   = {2025}
}

备注

Accepted by ICME2025