中文

风格引导运动扩散:可控舞蹈生成

计算机视觉与模式识别 2026-03-11 v3 多媒体 声音 音频与语音处理

摘要

舞蹈作为一种艺术形式和表达在人类文化中占据重要位置,但自动生成舞蹈序列是一项具有挑战性的任务。现有方法常忽视舞蹈生成中可控性的关键方面,并且不充分建模音乐风格对舞蹈的细微影响,导致生成的舞蹈缺乏与条件音乐所固有表达特征的一致性。为此,我们提出Style-Guided Motion Diffusion (SGMD),其集成了基于Transformer的架构和风格调制模块。通过融合音乐特征和用户提供的风格提示,SGMD确保生成的舞蹈不仅与音乐内容匹配,而且反映所需的风格特征。为实现对生成舞蹈的灵活控制,我们引入了时空掩码机制。由于可控舞蹈生成尚未得到充分研究,我们构建了相应的实验设置和基准,用于轨迹基舞蹈生成、舞蹈插值和舞蹈填充等任务。大量实验表明,我们的方法能够生成逼真且风格一致的舞蹈,同时也赋予用户创建符合不同艺术和实际需求的舞蹈的能力。代码可在Github上获取:https://github.com/mucunzhuzhu/DGSDP

关键词

引用

@article{arxiv.2406.07871,
  title  = {Controllable Dance Generation with Style-Guided Motion Diffusion},
  author = {Hongsong Wang and Ying Zhu and Xin Geng and Liang Wang},
  journal= {arXiv preprint arXiv:2406.07871},
  year   = {2026}
}