中文

PF-D2M:一种用于通用舞蹈到音乐生成的无姿态扩散模型

声音 2026-01-23 v1 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

舞蹈到音乐生成旨在生成与舞蹈动作对齐的音乐。现有方法通常依赖于从单个舞者提取的身体运动特征以及有限的舞蹈到音乐数据集,这限制了其在涉及多舞者和非人舞者的真实场景中的性能与适用性。本文提出 PF-D2M,一种通用的基于扩散的舞蹈到音乐生成模型,该模型融合了从舞蹈视频中提取的视觉特征。PF-D2M 采用渐进式训练策略进行训练,有效解决了数据稀缺和泛化挑战。客观和主观评估均表明,PF-D2M 在舞蹈-音乐对齐度和音乐质量方面达到了最先进的性能。

关键词

引用

@article{arxiv.2601.15872,
  title  = {PF-D2M: A Pose-free Diffusion Model for Universal Dance-to-Music Generation},
  author = {Jaekwon Im and Natalia Polouliakh and Taketo Akama},
  journal= {arXiv preprint arXiv:2601.15872},
  year   = {2026}
}

备注

4 pages, 2 figures