中文

基于能量模型的潜在空间人类运动生成——EnergyMoGen

计算机视觉与模式识别 2025-06-05 v2

摘要

扩散模型,特别是潜在扩散模型,在文本驱动的人类运动生成中展现出显著的成功。然而,这些潜在扩散模型在将多个语义概念有效组合到单个连贯运动序列中仍然具有挑战。为此,我们提出EnergyMoGen,包括两个能量模型范畴:(1) 我们将扩散模型解释为一种潜在感知的能量基模型,通过在潜在空间中组合一组扩散模型来生成运动;(2) 我们引入基于交叉注意力的语义感知能量模型,使其能够进行语义组合和针对文本嵌入进行自适应梯度下降。为克服这两个范畴之间语义不一致和运动畸变的挑战,我们引入Synergistic Energy Fusion。这一设计使运动潜在扩散模型能够通过组合对应文本描述的多个能量项来合成高质量、复杂的运动。实验表明,我们的方法在各种运动生成任务上优于现有的SOTA模型,包括文本到运动生成、构图运动生成和多概念运动生成。此外,我们演示了该方法可用于扩展运动数据集以提高文本到运动任务。

关键词

引用

@article{arxiv.2412.14706,
  title  = {EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space},
  author = {Jianrong Zhang and Hehe Fan and Yi Yang},
  journal= {arXiv preprint arXiv:2412.14706},
  year   = {2025}
}

备注

Accepted to CVPR 2025. Project page: https://jiro-zhang.github.io/EnergyMoGen/