中文

面向音乐的比较式音频-语言学习

声音 2022-08-26 v1 计算与语言 机器学习 音频与语音处理

摘要

作为人类已知最直观的接口之一,自然语言有潜力调解许多涉及人机交互的任务,尤其是在音乐信息检索等以应用为导向的领域。在本工作中,我们探索跨模态学习,试图在音乐领域架起音频与语言之间的桥梁。为此,我们提出 MusCALL,一个用于音乐比较式音频-语言学习(Music Contrastive Audio-Language Learning)的框架。我们的方法采用双编码器架构,学习音乐音频与描述性句子对之间的对齐,生成可直接用于文本到音频和音频到文本检索的多模态嵌入。得益于这一特性,MusCALL 几乎可以迁移到任何可表述为基于文本的检索的任务。我们的实验表明,我们的方法在检索与文本描述匹配的音频,以及反之检索与音频查询匹配的文本方面,显著优于基线方法。我们还展示了我们模型的多模态对齐能力可以成功扩展到两个公开数据集上流派分类与自动标注的零样本迁移场景。

关键词

引用

@article{arxiv.2208.12208,
  title  = {Contrastive Audio-Language Learning for Music},
  author = {Ilaria Manco and Emmanouil Benetos and Elio Quinton and György Fazekas},
  journal= {arXiv preprint arXiv:2208.12208},
  year   = {2022}
}

备注

Accepted to ISMIR 2022