中文

编码化音频语言建模学习到对音乐信息检索有用的表示

声音 2021-07-14 v1 信息检索 机器学习 多媒体 音频与语音处理

摘要

我们证明了在编码化(离散编码)音乐音频上预训练的语言模型学习到的表示对下游 MIR 任务有用。具体而言,我们探索了 Jukebox(Dhariwal 等人,2020)的表示:这是一个音乐生成系统,包含一个在来自 100 万首歌曲的编码化音频上训练的语言模型。为了确定 Jukebox 的表示是否包含对 MIR 有用的信息,我们将它们作为输入特征,在多个 MIR 任务上训练浅层模型。相对于在标注任务上预训练的传统 MIR 模型的表示,我们发现使用 Jukebox 的表示作为输入特征在四个 MIR 任务(标注、流派分类、情感识别与调性检测)上平均带来强 30% 的性能。对于调性检测,我们观察到 Jukebox 的表示明显强于在标注上预训练的模型,这表明通过编码化音频语言建模进行预训练可解决传统方法中的盲点。我们将 Jukebox 表示的优势解释为证据,表明对音频而非标签建模为 MIR 提供了更丰富的表示。

关键词

引用

@article{arxiv.2107.05677,
  title  = {Codified audio language modeling learns useful representations for music information retrieval},
  author = {Rodrigo Castellon and Chris Donahue and Percy Liang},
  journal= {arXiv preprint arXiv:2107.05677},
  year   = {2021}
}

备注

To appear in the proceedings of ISMIR 2021