扩散运动:通过扩散模型生成文本引导的 3D 人体运动
计算机视觉与模式识别
2023-04-17 v2
摘要
我们提出一种简单而新颖的方法,用于从复杂的自然语言句子生成 3D 人体运动,这些句子描述了各类动作的不同速度、方向和组合。不同于使用经典生成架构的现有方法,我们将去噪扩散概率模型(Denoising Diffusion Probabilistic Model)应用于该任务,在文本引导下合成多样的运动结果。扩散模型通过具有一系列去噪步骤的马尔可夫过程将白噪声转换为结构化的 3D 运动,并通过优化变分下界高效训练。为实现文本条件图像合成的目标,我们在训练期间使用无分类器引导(classifier-free guidance)策略将文本嵌入融合到模型中。我们的实验表明,我们的模型在 HumanML3D 测试集上定量取得了有竞争力的结果,并能生成视觉上更自然和多样的样例。我们还通过实验表明,我们的模型能够对未见过的文本引导进行零样本(zero-shot)运动生成。
引用
@article{arxiv.2210.12315,
title = {Diffusion Motion: Generate Text-Guided 3D Human Motion by Diffusion Model},
author = {Zhiyuan Ren and Zhihong Pan and Xin Zhou and Le Kang},
journal= {arXiv preprint arXiv:2210.12315},
year = {2023}
}
备注
Accepted by ICASSP 2023