中文

基于理论的可解释深度学习架构用于音乐情感识别

声音 2024-08-15 v1 人工智能 人机交互 音频与语音处理

摘要

本文提出了一种基于理论的、可解释的深度卷积神经网络(CNN)分类器,用于预测音乐的时间变化情感反应。我们设计了利用声学物理中已知的频率谐波结构来影响音乐特征感知的新型CNN滤波器。基于理论的模型更为简洁,但提供了与无理论深度学习模型相当的预测性能,同时优于使用手工特征的模型。我们的模型可以补充手工特征,但性能提升微乎其微。重要的是,置于CNN滤波器上的谐波结构提供了更好的可解释性,说明模型如何预测情感反应(效价和唤醒度),因为情感与协和度密切相关——协和度是由谐波对齐定义的一种感知特征。最后,我们通过一个涉及数字广告的应用说明了模型的实用性。受YouTube中插广告的启发,我们进行了一项实验室实验,在视频的不同时间点外生插入广告。我们发现,放置在情感相似上下文中的广告能提高广告参与度(更低的跳过率、更高的品牌回忆率)。基于我们基于理论的、可解释模型预测的情感相似性指标进行广告插入,产生的参与度与无理论模型相当或更好。

关键词

引用

@article{arxiv.2408.07113,
  title  = {A Theory-Based Explainable Deep Learning Architecture for Music Emotion},
  author = {Hortense Fong and Vineet Kumar and K. Sudhir},
  journal= {arXiv preprint arXiv:2408.07113},
  year   = {2024}
}