中文

基于提示类比的语言引导视频音乐推荐

计算机视觉与模式识别 2023-06-16 v1

摘要

我们提出一种为输入视频推荐音乐的方法,同时允许用户以自由形式自然语言引导音乐选择。该问题设置的一个关键挑战是,现有音乐视频数据集提供了所需的(视频,音乐)训练对,但缺乏音乐的文字描述。本工作通过以下三点贡献应对该挑战。首先,我们提出一种文本合成方法,该方法依赖于基于类比的提示过程,在给定预训练音乐标注器输出和少量人工文本描述的情况下,从大规模语言模型(BLOOM-176B)生成自然语言音乐描述。其次,我们利用这些合成的音乐描述训练一个新的三模态模型,该模型融合文本与视频输入表示来查询音乐样本。在训练中,我们引入一种文本丢弃正则化机制,并证明其对模型性能至关重要。我们的模型设计使检索到的音乐音频能通过匹配视频中描绘的视觉风格以及自然语言查询中描述的音乐流派、情绪或乐器,与两种输入模态一致。第三,为评估我们的方法,我们通过从YT8M-MusicVideo数据集中标注一个包含4k片段的子集并配以自然语言音乐描述来收集测试数据集,该数据集已公开。我们表明,在视频到音乐检索上,我们的方法能匹配或超越先前方法的性能,同时在使用文本引导时显著提升检索准确率。

关键词

引用

@article{arxiv.2306.09327,
  title  = {Language-Guided Music Recommendation for Video via Prompt Analogies},
  author = {Daniel McKee and Justin Salamon and Josef Sivic and Bryan Russell},
  journal= {arXiv preprint arXiv:2306.09327},
  year   = {2023}
}

备注

CVPR 2023 (Highlight paper). Project page: https://www.danielbmckee.com/language-guided-music-for-video