中文

用于可解释声音分类的焦点调制网络

声音 2024-02-07 v1 机器学习 音频与语音处理

摘要

深度神经网络日益增长的成功引发了对其固有黑盒性质的担忧,这给可解释性和信任带来了挑战。尽管在视觉和语言领域已经广泛探索了解释技术,但音频领域的可解释性受到的关注有限,主要集中在事后解释上。本文通过利用最近提出的无注意力焦点调制网络(FocalNets)来解决音频领域中的设计可解释性问题。我们首次将FocalNets应用于环境声音分类任务,并在流行的ESC-50数据集上评估其可解释性属性。我们的方法在准确性和可解释性方面均优于类似大小的视觉变换器。此外,它与PIQ(一种专门为音频领域事后解释设计的方法)相比具有竞争力。

关键词

引用

@article{arxiv.2402.02754,
  title  = {Focal Modulation Networks for Interpretable Sound Classification},
  author = {Luca Della Libera and Cem Subakan and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2402.02754},
  year   = {2024}
}

备注

Accepted to ICASSP 2024 XAI-SA Workshop