MixerMDM:人类运动扩散模型的可学习组合
计算机视觉与模式识别
2025-04-02 v1
摘要
受条件(如文本描述)引导的人类运动生成具有挑战性,因为需要具备质量较高的运动及其对应条件的配对数据集。若追求更细致的控制,挑战更为严峻。为此,先前工作提出将多个在不同类型条件数据集上预训练的运动扩散模型组合,从而实现多条件控制。然而,这些合并策略忽视了最佳组合方式可能取决于每个预训练生成模型的特性以及具体的文本描述。在此背景下,我们引入MixerMDM——首个用于组合预训练文本条件人类运动扩散模型的可学习模型组合技术。不同于以往方法,MixerMDM提供经过对抗式训练的动态混合策略,以学习根据驱动生成的条件集合来组合各模型的去噪过程。通过MixerMDM组合单人和多人运动扩散模型,我们实现了对每个个体动态的细粒度控制,以及整体相互作用的控制。此外,我们提出了一种新的评估技术,首次在此类任务中衡量相互作用和个体质量,通过计算混合生成运动与其条件之间的对齐程度,以及MixerMDM在去噪过程中根据待混合运动调整混合方式的能力。
引用
@article{arxiv.2504.01019,
title = {MixerMDM: Learnable Composition of Human Motion Diffusion Models},
author = {Pablo Ruiz-Ponce and German Barquero and Cristina Palmero and Sergio Escalera and José García-Rodríguez},
journal= {arXiv preprint arXiv:2504.01019},
year = {2025}
}
备注
CVPR 2025 Accepted - Project Page: https://pabloruizponce.com/papers/MixerMDM