MoLA:基于对抗训练的潜在扩散运动生成与编辑
计算机视觉与模式识别
2025-04-15 v4
摘要
在文本到运动生成中,可控性以及生成质量和速度日益受到关注。可控性挑战包括生成长度与给定文本描述匹配的运动,以及根据控制信号(如起始-结束位置和骆驼峰轨迹)编辑生成的运动。本文提出MoLA,实现快速、高质量、可变长的运动生成,并能在单一框架内处理多种编辑任务。我们的方法重新审视模型输入输出中使用的运动表示,引入激活变量以实现可变长运动生成。此外,我们集成变分自编码器和潜在扩散模型,并通过对抗训练实现高质量快速生成。我们还应用训练自由的引导生成框架,以实现运动控制输入下的各种编辑任务。我们定量地展示了对抗学习在文本到运动生成中的有效性,并展示了编辑框架在运动领域多个编辑任务中的适用性。
引用
@article{arxiv.2406.01867,
title = {MoLA: Motion Generation and Editing with Latent Diffusion Enhanced by Adversarial Training},
author = {Kengo Uchida and Takashi Shibuya and Yuhta Takida and Naoki Murata and Julian Tanke and Shusuke Takahashi and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2406.01867},
year = {2025}
}
备注
CVPR 2025 HuMoGen Workshop