中文

利用源分离实现具有音乐意义的可解释性

声音 2020-09-07 v1 信息检索 机器学习 音频与语音处理

摘要

深度神经网络(DNNs)已成功应用于多种音乐信息检索(MIR)任务中。这类模型通常被视为“黑盒”,即其预测结果不可解释。先前关于 MIR 中可解释模型的研究一般使用图像处理工具来生成 DNN 预测的解释,但这些解释未必具有音乐意义,也未必可听(而在音乐中,可听性可以说很重要)。我们提出 audioLIME,一种基于局部可解释模型无关解释(LIME)的方法,并通过音乐性的局部性定义对其进行了扩展。LIME 在我们欲解释的样例的扰动上学习局部线性模型。我们不建议在 LIME 流程中使用图像分割来提取频谱图的成分,而是提出使用源分离。扰动通过开启/关闭声源来创建,这使得我们的解释可被聆听。我们首先在一个被刻意训练为将真实目标与伪信号混淆的分类器上验证 audioLIME,并表明使用我们的方法可轻易检测出该问题。接着我们展示它通过了诸多现有解释方法未能通过的合理性检验。最后,我们在第三方音乐标注器上展示了我们(模型无关的)方法的普遍适用性。

关键词

引用

@article{arxiv.2009.02051,
  title  = {Towards Musically Meaningful Explanations Using Source Separation},
  author = {Verena Haunschmid and Ethan Manilow and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2009.02051},
  year   = {2020}
}

备注

6+2 pages, 4 figures; Submitted to International Society for Music Information Retrieval Conference 2020