中文

DuetGen:基于层次遮盖建模的音乐驱动两人舞蹈生成

图形学 2025-06-24 v1 计算机视觉与模式识别 声音 音频与语音处理

摘要

我们提出了 DuetGen,一个用于从音乐生成互动两人舞蹈的新框架。该任务的关键挑战在于两人舞蹈互动的内在复杂性,舞伙需要同时与彼此以及音乐保持同步。灵感来源于最近的动作合成进展,我们提出了两阶段解决方案:将两人运动编码为离散标记,然后从音乐生成这些标记。为有效捕捉复杂的互动,我们将两位舞者的运动表示为统一的整体,以学习必要的运动标记,并在两个阶段采用粗到细的学习策略。我们的第一阶段利用 VQ-VAE 在粗糙时间分辨率上分离高层语义特征,在更细的时间分辨率上分离低层细节,生成不同抽象水平的两个离散标记序列。随后在第二个阶段,两个生成式遮盖变换器学习将音乐信号映射到这些舞蹈标记:第一个产生高层语义标记,第二个在音乐和这些语义标记的条件下产生低层标记。我们训练两个变换器以预测序列中被随机遮盖的标记,使其在推理过程中能够通过填充空白标记序列来迭代生成运动标记。通过层次遮盖建模和专门的互动表示,DuetGen 实现了在各种音乐类型下同步且互动的两人舞蹈生成。广泛的实验和用户研究表明,DuetGen 在运动真实性、音乐-舞蹈对齐和舞伙配合方面均实现了最先进的性能。

关键词

引用

@article{arxiv.2506.18680,
  title  = {DuetGen: Music Driven Two-Person Dance Generation via Hierarchical Masked Modeling},
  author = {Anindita Ghosh and Bing Zhou and Rishabh Dabral and Jian Wang and Vladislav Golyanik and Christian Theobalt and Philipp Slusallek and Chuan Guo},
  journal= {arXiv preprint arXiv:2506.18680},
  year   = {2025}
}

备注

11 pages, 7 figures, 2 tables, accepted in ACM Siggraph 2025 conference track