中文

TCDiff++:面向和谐音乐驱动群体舞蹈的端到端轨迹可控扩散模型

声音 2025-10-07 v4 计算机视觉与模式识别 图形学 音频与语音处理

摘要

音乐驱动的舞蹈生成因其在工业应用中的广泛前景而受到广泛关注,尤其是用于群体舞蹈的创作。在群体舞蹈生成过程中,现有大多数方法仍面临三个主要问题:多舞者碰撞、单舞者脚步滑动以及长时间生成时的突然位置切换。本文提出TCDiff++,一个面向生成和谐群体舞蹈的音乐驱动端到端框架。具体而言,为缓解多舞者碰撞,我们利用舞者定位嵌入来编码时间和身份信息。此外,我们引入距离一致性损失以确保舞者间距离保持在合理范围内。为解决单舞者脚步滑动问题,我们引入交换模式嵌入以指示舞者交换模式,设计Footwork Adaptor以细化原始运动,从而最小化脚步滑动。对于长时程群体舞蹈生成,我们提出长程群体扩散采样策略,通过注入位置信息于带噪输入中,以减少突然的位置位移。进一步,我们集成Sequence Decoder层以增强模型对长序列的选择性处理能力。大量实验表明,TCDiff++实现了最先进的性能,尤其在持续时间较长的场景中,确保了高质量和连贯的群体舞蹈生成。

关键词

引用

@article{arxiv.2506.18671,
  title  = {TCDiff++: An End-to-end Trajectory-Controllable Diffusion Model for Harmonious Music-Driven Group Choreography},
  author = {Yuqin Dai and Wanlu Zhu and Ronghui Li and Xiu Li and Zhenyu Zhang and Jun Li and Jian Yang},
  journal= {arXiv preprint arXiv:2506.18671},
  year   = {2025}
}