MATHDance:面向高质量3D舞蹈生成的Mamba-Transformer混合架构与统一分词
声音
2026-04-02 v3 图形学
多媒体
音频与语音处理
摘要
音乐到舞蹈生成是一项横跨编舞、虚拟现实与创意内容生成的具有挑战性且至关重要的任务。尽管意义重大,现有方法在实现编舞一致性方面存在显著局限。为此,我们提出MatchDance,一个用于音乐到舞蹈生成的新型框架,通过构建潜在表征来增强编舞一致性。MatchDance采用两阶段设计:(1)基于运动学-动力学的量化阶段(KDQS),通过有限标量量化(FSQ)并施加运动学-动力学约束,将舞蹈动作编码为潜在表征,并以高保真度重构它们;(2)混合音乐到舞蹈生成阶段(HMDGS),使用Mamba-Transformer混合架构将音乐映射到潜在表征,随后通过KDQS解码器生成3D舞蹈动作。此外,本文还引入了音乐-舞蹈检索框架和全面评估指标。大量实验在FineDance数据集上表明,本方法实现了最先进的性能。
引用
@article{arxiv.2505.14222,
title = {MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation},
author = {Kaixing Yang and Xulong Tang and Ziqiao Peng and Yuxuan Hu and Xiangyue Zhang and Puwei Wang and Hongyan Liu and Jun He and Zhaoxin Fan},
journal= {arXiv preprint arXiv:2505.14222},
year = {2026}
}