面向音频分类器的可聆听地图
声音
2024-06-21 v3 机器学习
音频与语音处理
信号处理
摘要
尽管深度学习模型在众多任务中表现卓越,但其复杂性为解释带来了挑战。这一挑战在音频信号领域尤为突出,因为 conveying解释本身就难以实现。为此,我们引入了面向音频分类器的可聆听地图(L-MAC),这是一种后置解释方法,可生成忠实且可聆听的解释。L-MAC 在预训练分类器上方堆叠一个解码器,以生成二元掩码,以突出显示输入音频中相关的部分。我们采用一种损失函数进行训练,该损失函数最大化分类器对掩码后部分的信心,同时最小化掩码前部分的模型输出概率。在针对内域和外域数据的定量评估中,L-MAC 持续产生比多种梯度和掩码方法更忠实的解释。此外,用户研究确认,平均而言,用户更喜欢所提出技术生成的解释。
引用
@article{arxiv.2403.13086,
title = {Listenable Maps for Audio Classifiers},
author = {Francesco Paissan and Mirco Ravanelli and Cem Subakan},
journal= {arXiv preprint arXiv:2403.13086},
year = {2024}
}
备注
Accepted to ICML 2024 (Oral)