中文

MusicInfuser: 让视频扩散模型聆听并舞蹈

综合数学 2025-03-21 v2

摘要

我们介绍 MusicInfuser,一种将预训练文本到视频扩散模型对齐以生成与指定音乐同步的高质量舞蹈视频的方法。与从零训练多模态音视频或音动作模型不同,我们的方法展示了如何有效地将现有的视频扩散模型适配以对齐音乐输入。我们提出一种基于引导类构造性影响函数的层级可适应性准则,用于选择可适应层,显著降低训练成本,同时即使在有限且专业数据集的情况下也能保留丰富的先验知识。实验表明,MusicInfuser 有效弥合了音乐与视频之间的差距,生成响应音乐的新颖且多样的舞蹈动作。此外,我们的框架对未见的音乐轨道、更长的视频序列以及非常规主题都表现出良好的泛化能力,在一致性和同步性方面优于基线模型。所有这一切都无需运动数据,仅用一块 GPU 在一天内即可完成训练。

引用

@article{arxiv.2503.14508,
  title  = {A remark on an explicit formula for the sums of powers of integers},
  author = {José L. Cereceda},
  journal= {arXiv preprint arXiv:2503.14508},
  year   = {2025}
}

备注

2 pages