MuLan:音乐音频与自然语言的联合嵌入
音频与语音处理
2022-08-29 v1 计算与语言
声音
机器学习
摘要
音乐标注和基于内容的检索系统传统上采用预定义本体构建,覆盖一组僵化的音乐属性或文本查询。本文提出 MuLan:新一代声学模型的首次尝试,其将音乐音频直接与无约束的自然语言音乐描述相链接。MuLan 采用双塔联合音频-文本嵌入模型的形式,使用 4400 万条音乐录音(37 万小时)和弱关联的自由形式文本标注进行训练。通过对广泛音乐流派和文本风格(包括常规音乐标签)的兼容,所得音频-文本表示在涵盖现有本体的同时,进阶至真正的零样本功能。我们通过一系列实验展示了 MuLan 嵌入的通用性,包括迁移学习、零样本音乐标注、音乐领域语言理解以及跨模态检索应用。
引用
@article{arxiv.2208.12415,
title = {MuLan: A Joint Embedding of Music Audio and Natural Language},
author = {Qingqing Huang and Aren Jansen and Joonseok Lee and Ravi Ganti and Judith Yue Li and Daniel P. W. Ellis},
journal= {arXiv preprint arXiv:2208.12415},
year = {2022}
}
备注
To appear in ISMIR 2022