中文

MoLA:基于对抗训练的潜在扩散运动生成与编辑

计算机视觉与模式识别 2025-04-15 v4

摘要

在文本到运动生成中,可控性以及生成质量和速度日益受到关注。可控性挑战包括生成长度与给定文本描述匹配的运动,以及根据控制信号(如起始-结束位置和骆驼峰轨迹)编辑生成的运动。本文提出MoLA,实现快速、高质量、可变长的运动生成,并能在单一框架内处理多种编辑任务。我们的方法重新审视模型输入输出中使用的运动表示,引入激活变量以实现可变长运动生成。此外,我们集成变分自编码器和潜在扩散模型,并通过对抗训练实现高质量快速生成。我们还应用训练自由的引导生成框架,以实现运动控制输入下的各种编辑任务。我们定量地展示了对抗学习在文本到运动生成中的有效性,并展示了编辑框架在运动领域多个编辑任务中的适用性。

关键词

引用

@article{arxiv.2406.01867,
  title  = {MoLA: Motion Generation and Editing with Latent Diffusion Enhanced by Adversarial Training},
  author = {Kengo Uchida and Takashi Shibuya and Yuhta Takida and Naoki Murata and Julian Tanke and Shusuke Takahashi and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2406.01867},
  year   = {2025}
}

备注

CVPR 2025 HuMoGen Workshop