用非负矩阵分解解决音频分类网络的可解释性问题
声音
2023-05-15 v1 机器学习
音频与语音处理
摘要
本文解决了音频处理网络可解释性的两个主要问题设定:事后解释与按设计解释。对于事后解释,我们旨在用对终端用户亦可听的高层音频对象来解释网络的决策。这被扩展以提出一种具有高性能的固有可解释模型。为此,我们提出了一种融合非负矩阵分解(NMF)的新颖解释器设计。具体而言,训练一个解释器从目标网络的隐藏层生成正则化的中间嵌入,该嵌入被学习为预学习 NMF 字典的时间激活。我们的方法允许我们生成直观的基于音频的解释,其显式增强输入信号中与网络决策最相关的部分。我们在多种分类任务上展示了方法的适用性,包括真实世界音频与音乐的多标签数据。
引用
@article{arxiv.2305.07132,
title = {Tackling Interpretability in Audio Classification Networks with Non-negative Matrix Factorization},
author = {Jayneel Parekh and Sanjeel Parekh and Pavlo Mozharovskyi and Gaël Richard and Florence d'Alché-Buc},
journal= {arXiv preprint arXiv:2305.07132},
year = {2023}
}
备注
Under submission at IEEE/ACM TASLP. arXiv admin note: text overlap with arXiv:2202.11479