用于可解释声音分类的焦点调制网络
声音
2024-02-07 v1 机器学习
音频与语音处理
摘要
深度神经网络日益增长的成功引发了对其固有黑盒性质的担忧,这给可解释性和信任带来了挑战。尽管在视觉和语言领域已经广泛探索了解释技术,但音频领域的可解释性受到的关注有限,主要集中在事后解释上。本文通过利用最近提出的无注意力焦点调制网络(FocalNets)来解决音频领域中的设计可解释性问题。我们首次将FocalNets应用于环境声音分类任务,并在流行的ESC-50数据集上评估其可解释性属性。我们的方法在准确性和可解释性方面均优于类似大小的视觉变换器。此外,它与PIQ(一种专门为音频领域事后解释设计的方法)相比具有竞争力。
引用
@article{arxiv.2402.02754,
title = {Focal Modulation Networks for Interpretable Sound Classification},
author = {Luca Della Libera and Cem Subakan and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2402.02754},
year = {2024}
}
备注
Accepted to ICASSP 2024 XAI-SA Workshop