中文

重新思考文本驱动的人类运动生成中的扩散模型:冗余表征、评估与掩码自回归

计算机视觉与模式识别 2025-07-10 v2

摘要

自 2023 年起,基于向量量化(VQ)的离散生成方法在人类运动生成领域迅速占据主导地位,主要优于基于扩散的连续生成方法在标准性能指标上。然而,VQ 方法存在固有局限性。将连续运动数据表示为有限数量的离散标记会导致信息必然丢失,降低生成运动的多样性,限制其作为运动先验或生成引导的有效性。相比之下,扩散方法的连续空间生成特性使其更适用于解决上述局限性,并具备模型可扩展性潜力。本文系统性地探讨了当前 VQ 方法为何表现良好,以及现有扩散方法在运动数据表征与分布方面的局限性。基于这些洞见,我们保留扩散式人类运动生成模型的固有优势,并致力于从 VQ 方法中汲取灵感进行逐步优化。我们的方法引入了能够实现掩码自回归的人类运动扩散模型,采用重新构思后的数据表征与分布进行优化。此外,我们提出了更稳健的评估方法以衡量不同方法的效果。在Various 数据集上的大量实验表明,我们的方法超越了先前的方法,实现了最先进的性能。

关键词

引用

@article{arxiv.2411.16575,
  title  = {Rethinking Diffusion for Text-Driven Human Motion Generation: Redundant Representations, Evaluation, and Masked Autoregression},
  author = {Zichong Meng and Yiming Xie and Xiaogang Peng and Zeyu Han and Huaizu Jiang},
  journal= {arXiv preprint arXiv:2411.16575},
  year   = {2025}
}

备注

CVPR 2025