基于可解释人工智能的音频事件分类输入表示比较
声音
2023-04-28 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
深度神经网络是音频事件分类的一种有前途的工具。与自然图像等其他数据不同,音频数据有许多合理且不明显的表示,可以作为这些模型的输入。由于其黑盒性质,到目前为止,不同输入表示的影响主要通过测量分类性能来研究。在这项工作中,我们利用可解释人工智能(XAI)来理解在不同输入表示上训练的模型的底层分类策略。具体而言,我们比较了两种模型架构在用于音频事件检测的相关输入特征方面的差异:一种直接将信号作为原始波形进行处理,另一种则采用其时频频谱图表示作为输入。我们展示了通过“Siren”{逐层相关性传播}获得的相关性热图如何揭示依赖于表示的决策策略。凭借这些见解,我们能够在鲁棒性和代表性方面对最佳输入表示做出明智的决定,并确认模型的分类策略符合人类需求。
引用
@article{arxiv.2304.14019,
title = {XAI-based Comparison of Input Representations for Audio Event Classification},
author = {Annika Frommholz and Fabian Seipel and Sebastian Lapuschkin and Wojciech Samek and Johanna Vielhaben},
journal= {arXiv preprint arXiv:2304.14019},
year = {2023}
}
备注
7 pages, 4 figures