中文

基于自注意力实现可解释音乐标注

声音 2019-06-13 v1 音频与语音处理

摘要

自注意力(self-attention)是一种通过关联序列中不同位置来学习表示的注意力机制。完全基于自注意力的序列模型 Transformer 及其变体在许多自然语言处理任务中取得了最先进(state-of-the-art)的结果。由于音乐基于稀疏位置中组分之间的关系构成其语义,采用自注意力机制解决音乐信息检索(MIR)问题可能是有益的。因此,我们提出了一种基于自注意力的深度序列模型用于音乐标注。所提架构由浅层卷积层与堆叠的 Transformer 编码器组成。与采用全卷积或循环神经网络的常规方法相比,我们的模型在报告具竞争力的结果的同时更具可解释性。我们使用 MagnaTagATune 与 Million Song Dataset 验证了模型的性能。此外,我们通过热力图可视化展示了所提架构的可解释性。

关键词

引用

@article{arxiv.1906.04972,
  title  = {Toward Interpretable Music Tagging with Self-Attention},
  author = {Minz Won and Sanghyuk Chun and Xavier Serra},
  journal= {arXiv preprint arXiv:1906.04972},
  year   = {2019}
}

备注

13 pages, 12 figures; code: https://github.com/minzwon/self-attention-music-tagging