基于自注意力实现可解释音乐标注
声音
2019-06-13 v1 音频与语音处理
摘要
自注意力(self-attention)是一种通过关联序列中不同位置来学习表示的注意力机制。完全基于自注意力的序列模型 Transformer 及其变体在许多自然语言处理任务中取得了最先进(state-of-the-art)的结果。由于音乐基于稀疏位置中组分之间的关系构成其语义,采用自注意力机制解决音乐信息检索(MIR)问题可能是有益的。因此,我们提出了一种基于自注意力的深度序列模型用于音乐标注。所提架构由浅层卷积层与堆叠的 Transformer 编码器组成。与采用全卷积或循环神经网络的常规方法相比,我们的模型在报告具竞争力的结果的同时更具可解释性。我们使用 MagnaTagATune 与 Million Song Dataset 验证了模型的性能。此外,我们通过热力图可视化展示了所提架构的可解释性。
引用
@article{arxiv.1906.04972,
title = {Toward Interpretable Music Tagging with Self-Attention},
author = {Minz Won and Sanghyuk Chun and Xavier Serra},
journal= {arXiv preprint arXiv:1906.04972},
year = {2019}
}
备注
13 pages, 12 figures; code: https://github.com/minzwon/self-attention-music-tagging