中文

利用非配对数据预训练和对比对齐的舞蹈配乐生成

声音 2026-07-12 v1 多媒体 音频与语音处理

摘要

舞蹈配乐生成是编舞支持和自动伴奏等应用中的一个有前景的任务,其中身体运动与声音之间的时间协调至关重要。特别是,使用人体关节位置作为运动表示很有吸引力,因为它们明确捕捉身体动态,同时轻量、保护隐私,并且易于与动作捕捉和姿态估计流程集成。然而,这种情况下的一个核心挑战是高质量配对舞蹈-音乐数据的稀缺性,因为收集精确同步的配对数据成本高昂,且常常受到版权和表演权的限制。这使得仅从配对数据端到端训练模型变得困难。为了解决这个问题,我们提出了一个舞蹈条件音乐生成框架,有效利用非配对和配对数据。我们的方法结合了用于运动和音乐的预训练单模态编码器、用于对齐其特征空间的节拍引导对比预训练,以及在预训练文本到音频扩散模型之上的ControlNet风格条件模块。在AIST++上的实验表明,所提出的技术改善了舞蹈-音乐对齐和音频质量,定量和定性评估均证实了这一点。与最先进的方法相比,我们的方法实现了优越的舞蹈对齐性能和具有竞争力的音频质量。代码可在 https://github.com/kmraven/AudioLDM-ControlNet 获取。

关键词

引用

@article{arxiv.2607.10537,
  title  = {Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment},
  author = {Ryota Kimura and Sangheon Park and Natalia Polouliakh and Taketo Akama},
  journal= {arXiv preprint arXiv:2607.10537},
  year   = {2026}
}

备注

7 pages, 1 figure