TokenDance:基于双向Mamba的Token到Token音乐到舞蹈生成
人工智能
2026-03-31 v1 计算机视觉与模式识别
声音
摘要
音乐到舞蹈生成在虚拟现实、舞蹈教育和数字角色动画中具有广泛应用。然而,现有3D舞蹈数据集的覆盖范围有限,导致当前模型仅能覆盖狭窄的音乐风格和编舞模式,从而在面对真实世界音乐时泛化能力差。因此,生成的舞蹈往往过于简单和重复,显著降低了表现力和真实感。为了解决这一问题,我们提出了TokenDance,一个两阶段的音乐到舞蹈生成框架,通过双模态tokenization和高效的token级生成显式地解决这一局限。在第一阶段,我们使用有限标量量化对舞蹈和音乐进行离散化,其中舞蹈动作在运动学-动力学约束下分解为上下半身组件,音乐则分解为语义特征和声学特征,并使用专用代码本捕捉编舞特有的结构。在第二阶段,我们引入了一个基于双向Mamba主干网络的局部-全局-局部token到token生成器,实现了连贯的运动合成、强大的音乐-舞蹈对齐以及高效的非自回归推理。广泛的实验表明,TokenDance在生成质量和推理速度两方面均达到了总体最先进的(SOTA)性能,突出了其在真实世界音乐到舞蹈应用中的有效性和实用价值。
引用
@article{arxiv.2603.27314,
title = {TokenDance: Token-to-Token Music-to-Dance Generation with Bidirectional Mamba},
author = {Ziyue Yang and Kaixing Yang and Xulong Tang},
journal= {arXiv preprint arXiv:2603.27314},
year = {2026}
}
备注
CVPR2026 Workshop on HuMoGen