中文

MEGADance:面向类型感知三维舞蹈生成的混合专家架构

声音 2026-02-24 v3 多媒体 音频与语音处理

摘要

音乐驱动的三维舞蹈生成近年来受到越来越多的关注,在编舞、虚拟现实和创意内容创作中具有广阔的应用前景。先前研究已从音频信号中生成逼真的舞蹈动作。然而,传统方法未能充分利用类型条件化,往往将其视为辅助修饰符而非核心语义驱动因素。这一疏忽损害了音乐-动作同步性,并在复杂的节奏转换期间破坏了舞蹈类型的连续性,从而导致视觉效果不佳。为解决这一挑战,我们提出了 MEGADance,一种用于音乐驱动三维舞蹈生成的新架构。通过将编舞一致性解耦为舞蹈通用性与类型特定性,MEGADance 展现了显著的舞蹈质量和强大的类型可控性。该架构包含两个阶段:(1)高保真舞蹈量化阶段(HFDQ),通过有限标量量化(FSQ)将舞蹈动作编码为潜在表示,并在运动学-动力学约束下重建;(2)类型感知舞蹈生成阶段(GADG),通过协同利用混合专家(MoE)机制与 Mamba-Transformer 混合骨干网络将音乐映射到潜在表示。在 FineDance 和 AIST++ 数据集上的广泛实验证明了 MEGADance 在定性和定量上均达到最先进的性能。代码地址:https://github.com/XulongT/MEGADance。

关键词

引用

@article{arxiv.2505.17543,
  title  = {MEGADance: Mixture-of-Experts Architecture for Genre-Aware 3D Dance Generation},
  author = {Kaixing Yang and Xulong Tang and Ziqiao Peng and Yuxuan Hu and Jun He and Hongyan Liu},
  journal= {arXiv preprint arXiv:2505.17543},
  year   = {2026}
}

备注

NeurIPS 2025