中文

MACE-Dance:面向音乐驱动舞蹈视频生成的运动-外观级联专家

计算机视觉与模式识别 2026-05-08 v3

摘要

随着在线舞蹈视频平台的兴起和 AI 生成内容 (AIGC) 的快速发展,音乐驱动舞蹈生成已成为引人关注的研究方向。尽管相关领域如音乐驱动 3D 舞蹈生成、基于姿态的图像动画和音频驱动说话头肖像合成等取得了显著进展,但现有方法无法直接适用于此任务。此外,该领域的研究仍有限,难以同时实现高质量的视觉外观和真实的人体动作。为此,我们提出 MACE-Dance,一个基于音乐驱动的舞蹈视频生成框架,采用级联混合专家 (Mixture-of-Experts, MoE) 结构。Motion Expert 执行音乐到 3D 动作生成,同时强制执行动力学可行性和艺术表达性;Appearance Expert 负责运动和参考条件下的视频合成,保持视觉身份一致性并实现时空一致性。具体而言,Motion Expert 采用一种结合 BiMamba-Transformer 混合架构和 Guidance-Free Training (GFT) 策略的扩散模型,实现了 3D 舞蹈生成的最新进展 (SOTA)。Appearance Expert 采用解耦 kinematic-aesthetic 精细调优策略,实现了基于姿态的图像动画的最新进展 (SOTA)。为更好地评估此任务,我们构建了大规模且多样化的数据集,并设计了运动-外观评估协议。在该协议下,MACE-Dance 也实现了最新进展 (SOTA) 的性能。代码已公开:https://github.com/AMAP-ML/MACE-Dance。

关键词

引用

@article{arxiv.2512.18181,
  title  = {MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation},
  author = {Kaixing Yang and Jiashu Zhu and Xulong Tang and Ziqiao Peng and Xiangyue Zhang and Puwei Wang and Jiahong Wu and Xiangxiang Chu and Hongyan Liu and Jun He},
  journal= {arXiv preprint arXiv:2512.18181},
  year   = {2026}
}

备注

Accepted by SIGGRAPH 2026