中文

将音乐情感预测追溯至声源与直观感知属性

声音 2021-06-17 v2 机器学习 音频与语音处理

摘要

音乐情感识别是 MIR(音乐信息检索)研究中的一项重要任务。由于任务的主观性以及不同音乐流派间情感线索的差异等因素,在开发可靠且可泛化的模型方面仍存在显著挑战。改进模型的一个重要步骤是理解模型实际从数据中学习了什么,以及针对特定输入的预测是如何做出的。在先前工作中,我们展示了如何根据频谱图图像片段推导模型预测的解释,这些片段通过一层易于解释的感知特征连接到高层情感预测。然而,该方案在频谱图层面缺乏直观的音乐可理解性。在本工作中,我们通过将 audioLIME——一种基于源分离的解释器——与中层感知特征相融合,弥补了这一差距,从而在输入音频与输出情感预测之间建立起直观的连接链。我们通过对一个存在偏差的情感预测模型进行调试,展示了该方法的有效性。

关键词

引用

@article{arxiv.2106.07787,
  title  = {Tracing Back Music Emotion Predictions to Sound Sources and Intuitive Perceptual Qualities},
  author = {Shreyan Chowdhury and Verena Praher and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2106.07787},
  year   = {2021}
}

备注

In Proceedings of the 18th Sound and Music Computing Conference (SMC 2021)