中文

MATHDance:面向高质量3D舞蹈生成的Mamba-Transformer混合架构与统一分词

声音 2026-04-02 v3 图形学 多媒体 音频与语音处理

摘要

音乐到舞蹈生成是一项横跨编舞、虚拟现实与创意内容生成的具有挑战性且至关重要的任务。尽管意义重大,现有方法在实现编舞一致性方面存在显著局限。为此,我们提出MatchDance,一个用于音乐到舞蹈生成的新型框架,通过构建潜在表征来增强编舞一致性。MatchDance采用两阶段设计:(1)基于运动学-动力学的量化阶段(KDQS),通过有限标量量化(FSQ)并施加运动学-动力学约束,将舞蹈动作编码为潜在表征,并以高保真度重构它们;(2)混合音乐到舞蹈生成阶段(HMDGS),使用Mamba-Transformer混合架构将音乐映射到潜在表征,随后通过KDQS解码器生成3D舞蹈动作。此外,本文还引入了音乐-舞蹈检索框架和全面评估指标。大量实验在FineDance数据集上表明,本方法实现了最先进的性能。

关键词

引用

@article{arxiv.2505.14222,
  title  = {MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation},
  author = {Kaixing Yang and Xulong Tang and Ziqiao Peng and Yuxuan Hu and Xiangyue Zhang and Puwei Wang and Hongyan Liu and Jun He and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2505.14222},
  year   = {2026}
}