面向零样本音乐标注的音乐与语言联合注意力模型
声音
2023-10-17 v1 计算与语言
音频与语音处理
摘要
音乐标注是一项预测音乐录音标签的任务。然而,以往的音乐标注研究主要关注闭集音乐标注任务,无法泛化到新标签。在这项工作中,我们提出了一种由音乐与语言联合注意力(JMLA)模型建模的零样本音乐标注系统,以解决开集音乐标注问题。JMLA 模型由一个由预训练掩码自编码器建模的音频编码器和一个由 Falcon7B 建模的解码器组成。我们引入了感知重采样器(preceiver resampler)将任意长度的音频转换为固定长度的嵌入。我们引入了编码器与解码器层之间的稠密注意力连接,以改善编码器与解码器层之间的信息流。我们从互联网收集了一个大规模音乐与描述数据集。我们提出使用 ChatGPT 将原始描述转换为形式化且多样化的描述来训练 JMLA 模型。我们提出的 JMLA 系统在 GTZAN 数据集上实现了 的零样本音频标注准确率,优于以往的零样本系统,并在 FMA 和 MagnaTagATune 数据集上取得了与以往系统相当的结果。
引用
@article{arxiv.2310.10159,
title = {Joint Music and Language Attention Models for Zero-shot Music Tagging},
author = {Xingjian Du and Zhesong Yu and Jiaju Lin and Bilei Zhu and Qiuqiang Kong},
journal= {arXiv preprint arXiv:2310.10159},
year = {2023}
}
备注
\begin{keywords} Music tagging, joint music and language attention models, Music Foundation Model. \end{keywords}