中文

MuLan:音乐音频与自然语言的联合嵌入

音频与语音处理 2022-08-29 v1 计算与语言 声音 机器学习

摘要

音乐标注和基于内容的检索系统传统上采用预定义本体构建,覆盖一组僵化的音乐属性或文本查询。本文提出 MuLan:新一代声学模型的首次尝试,其将音乐音频直接与无约束的自然语言音乐描述相链接。MuLan 采用双塔联合音频-文本嵌入模型的形式,使用 4400 万条音乐录音(37 万小时)和弱关联的自由形式文本标注进行训练。通过对广泛音乐流派和文本风格(包括常规音乐标签)的兼容,所得音频-文本表示在涵盖现有本体的同时,进阶至真正的零样本功能。我们通过一系列实验展示了 MuLan 嵌入的通用性,包括迁移学习、零样本音乐标注、音乐领域语言理解以及跨模态检索应用。

关键词

引用

@article{arxiv.2208.12415,
  title  = {MuLan: A Joint Embedding of Music Audio and Natural Language},
  author = {Qingqing Huang and Aren Jansen and Joonseok Lee and Ravi Ganti and Judith Yue Li and Daniel P. W. Ellis},
  journal= {arXiv preprint arXiv:2208.12415},
  year   = {2022}
}

备注

To appear in ISMIR 2022