中文

TeMuDance:基于对齐的文本控制方法用于音乐驱动舞蹈生成

计算机视觉与模式识别 2026-04-21 v1 声音

摘要

现有的音乐驱动舞蹈生成方法已实现较强的逼真度和音频-动作对齐效果。然而,这些方法通常缺乏语义可控性,难以通过自然语言描述来指导特定动作。这种局限主要源于缺乏大规模的联合对齐音乐、文本和动作数据,用于监督学习文本条件控制。为解决此挑战,我们提出了TeMuDance框架,使其能够在不依赖手动标注的音乐-文本-动作三元组数据集的情况下,实现音乐条件舞蹈生成的文本控制。TeMuDance引入一种以动作为中心的桥接范式,利用动作为共享语义锚点,将分离的音乐-舞蹈和文本-动作数据集在统一的嵌入空间中对齐,从而实现跨模态检索,以实现端到端训练。在冻结的音乐到舞蹈扩散模型之上训练一个轻量级文本控制分支,既保留节奏保真度,又实现细粒度语义指导。为进一步抑制检索监督中固有的噪声,我们设计了基于置信度过滤的双流微调策略。我们还提出了一种新颖的任务对齐度量标准,用于量化文本提示在音乐条件下是否诱导预期的运动学属性。大量实验表明,TeMuDance在实现竞争性的舞蹈质量的同时,显著提升了文本条件控制能力。

关键词

引用

@article{arxiv.2604.17005,
  title  = {TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation},
  author = {Xinran Liu and Diptesh Kanojia and Wenwu Wang and Zhenhua Feng},
  journal= {arXiv preprint arXiv:2604.17005},
  year   = {2026}
}