中文

通过语言桥接高质量音频与视频以实现基于视觉查询的音效检索

声音 2023-08-21 v1 计算机视觉与模式识别 信息检索 多媒体 音频与语音处理

摘要

为视频中的特定时刻寻找合适的音效(SFX)是一项困难且耗时的任务,且在很大程度上依赖于文本元数据的质量与完整性。直接使用视频帧作为查询来检索高质量(HQ)SFX是一种颇具吸引力的替代方案,它摆脱了对文本元数据的依赖,并为非专业人士提供了低门槛的入口。由于缺乏HQ视听训练数据,先前关于视听检索的工作依赖于质量参差不齐的YouTube(野外)视频进行训练,其中音频通常含有噪声且视频为业余质量。因此,尚不清楚这些系统是否能泛化到将HQ音频与制作级视频相匹配的任务。为此,我们提出了一种多模态框架,用于给定视频帧推荐HQ SFX,该框架通过(1)利用大语言模型和基础视觉-语言模型将HQ音频与视频桥接以创建视听对,从而构建一个高度可扩展的自动视听数据整理流水线;以及(2)使用预训练的音频与视觉编码器训练基于对比学习的检索系统。我们表明,使用我们的自动数据整理流水线训练的系统,在视频HQ SFX检索任务上显著优于在野外数据上训练的基线。此外,尽管基线无法泛化到该任务,我们的系统能从干净数据良好地泛化到野外数据,即使在仅使用HQ视听对训练的情况下,也在YouTube视频数据集上优于基线。一项用户研究证实,无论对于HQ还是野外数据,人们有67%的时间更倾向于选择我们系统检索出的SFX而非基线。最后,我们给出了消融实验,以确定模型与数据流水线设计选择对下游检索性能的影响。请访问我们的项目网站以收听和查看我们的SFX检索结果。

关键词

引用

@article{arxiv.2308.09089,
  title  = {Bridging High-Quality Audio and Video via Language for Sound Effects Retrieval from Visual Queries},
  author = {Julia Wilkins and Justin Salamon and Magdalena Fuentes and Juan Pablo Bello and Oriol Nieto},
  journal= {arXiv preprint arXiv:2308.09089},
  year   = {2023}
}

备注

WASPAA 2023. Project page: https://juliawilkins.github.io/sound-effects-retrieval-from-video/. 4 pages, 2 figures, 2 tables