中文

不像 Transformer:基于 Mamba 的鼓点表示为舞蹈生成 Dropping the Beat

计算机视觉与模式识别 2026-03-10 v1 人工智能 图形学 声音

摘要

舞蹈是一种具有情感表达和沟通功能的人类动作,广泛应用于音乐、虚拟现实和内容创建等领域。现有的舞蹈生成方法往往难以充分捕捉舞蹈 inherently sequential、节律性和音乐同步性特征。本文提出了 \emph{MambaDance},一种基于 Mamba 的扩散模型的舞蹈生成方法。Mamba 因其处理长序列和自回归序列的能力而被整合到我们的两阶段扩散架构中,取代了即插即用的 Transformer。此外,考虑到音乐节拍在舞蹈编排中的关键作用,我们提出了一种基于高斯分布的鼓点表示,以显式引导舞蹈序列的解码。在 AIST++ 和 FineDance 数据集上进行的每个序列长度的实验表明,我们提出的方法能够生成符合逻辑的舞蹈动作,同时反映其基本特征,从短舞蹈到长舞蹈均表现出色。附加的定性结果和演示视频可在 \small{https://vision3d-lab.github.io/mambadance} 查看。

关键词

引用

@article{arxiv.2603.08023,
  title  = {Not Like Transformers: Drop the Beat Representation for Dance Generation with Mamba-Based Diffusion Model},
  author = {Sangjune Park and Inhyeok Choi and Donghyeon Soon and Youngwoo Jeon and Kyungdon Joo},
  journal= {arXiv preprint arXiv:2603.08023},
  year   = {2026}
}

备注

Accepted by WACV 2026