中文

You Think, You ACT: 任意文本到动作生成的新任务

计算机视觉与模式识别 2025-07-01 v6

摘要

Text to Motion 旨在从文本生成人体动作。现有设置依赖于包含动作标签的有限动作文本,这在难以直接描述的场景中限制了灵活性和实用性。本文将有限的动作文本扩展为任意文本。没有显式动作标签的场景文本可以增强模型在虚拟人交互、机器人行为生成和电影制作等复杂多样行业中的实用性,同时也支持对潜在隐式行为模式的探索。然而,新引入的场景文本可能产生多个合理的输出结果,对现有数据、框架和评估提出了重大挑战。为了解决这一实际问题,我们首先通过扩展现有最大数据集 HUMANML3D 的文本,创建了一个新数据集 HUMANML3D++。其次,我们提出了一个简单而有效的框架,该框架从任意文本中提取动作指令并随后生成动作。此外,我们还使用多解指标对这个新设置进行了基准测试,以解决现有单解指标的不足。大量实验表明,在这种现实设置下的 Text to Motion 具有挑战性,促进了这一实用方向的新研究。

关键词

引用

@article{arxiv.2404.14745,
  title  = {You Think, You ACT: The New Task of Arbitrary Text to Motion Generation},
  author = {Runqi Wang and Caoyuan Ma and Guopeng Li and Hanrui Xu and Yuke Li and Zheng Wang},
  journal= {arXiv preprint arXiv:2404.14745},
  year   = {2025}
}

备注

accept to iccv2025