用于文本到动作生成的重建锚定扩散模型
计算机视觉与模式识别
2026-01-22 v1
摘要
扩散模型因其令人印象深刻的生成能力和灵活性,在文本驱动的人体动作生成及相关任务中得到了广泛应用。然而,当前的动作扩散模型面临两大主要局限:一是缺乏动作特定信息的预训练文本编码器导致的表征鸿沟,二是迭代去噪过程中的误差传播。本文引入了重建锚定扩散模型(RAM)以应对这些挑战。首先,RAM 利用动作潜在空间作为文本到动作生成的中间监督。为此,RAM 共同训练了一个动作重建分支,包含两个关键目标函数:用于增强动作空间判别能力的自正则化,以及用于实现从文本到动作潜在空间精确映射的以动作为中心的潜在对齐。其次,我们提出了重建误差引导(REG),这是一种测试阶段的引导机制,利用扩散模型固有的自校正能力来缓解误差传播。在每个去噪步骤中,REG 使用动作重建分支重建先前的估计,重现先前的误差模式。通过放大当前预测与重建估计之间的残差,REG 突出了当前预测中的改进。大量实验表明,RAM 取得了显著的改进和 SOTA 性能。我们的代码将发布。
引用
@article{arxiv.2601.14788,
title = {Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation},
author = {Yifei Liu and Changxing Ding and Ling Guo and Huaiguang Jiang and Qiong Cao},
journal= {arXiv preprint arXiv:2601.14788},
year = {2026}
}