中文

基于 CNN 的声学信号分类模型可解释性研究

声音 2025-09-11 v1 人工智能 机器学习 音频与语音处理

摘要

可解释人工智能 (XAI) 作为解释复杂深度学习模型预测结果的关键工具,近年来在声学领域的 various applications 中得到广泛应用,但在生物声学领域(即分析来自生物组织的音频信号)的应用仍相对不足。本文研究了一种在北美范围内具有显著地理变异的鸟类种类的鸣声。将音频录音转换为频谱图图像,并用于训练深度卷积神经网络 (CNN) 进行分类,实现率达 94.8%。为解释模型的预测结果,我们应用了模型不可知技术 (LIME, SHAP) 和模型特定技术 (DeepLIFT, Grad-CAM) 进行 XAI 处理。这些技术产生的解释虽有差异但互为补充,综合运用这些解释可提供更完整、更具可解释性的对模型决策过程的洞察。本工作强调了在更广泛的声学信号分析中,以及在不同特定任务中的应用中,采用多种 XAI 技术组合使用以提升信任和可互操作性的重要性。

关键词

引用

@article{arxiv.2509.08717,
  title  = {Explainability of CNN Based Classification Models for Acoustic Signal},
  author = {Zubair Faruqui and Mackenzie S. McIntire and Rahul Dubey and Jay McEntee},
  journal= {arXiv preprint arXiv:2509.08717},
  year   = {2025}
}

备注

Accepted in IEEE ICTAI 2025