中文

APEX:面向分类任务的音频原型解释

声音 2026-05-12 v1 机器学习

摘要

可解释 AI(XAI)在图像分类领域取得了显著成功,但音频领域缺乏同样成熟的解决方案。现有方法将基于视觉的归因技术应用于频谱图,忽略了视觉信号与声学信号之间的根本差异。尽管原型推理具有潜力,但声学相似性依然呈多维特征。我们引入了 APEX(Audio Prototype EXplanations),一种用于解释预训练音频分类器的事后框架。关键的是,APEX 无需对原始主干网络进行微调,并严格保持输出不变性。APEX 将解释解耦为四个视角:基于方块的原型用于定位瞬态事件,基于时间的原型用于捕捉时域模式,基于频率的原型用于突出频带,以及基于时频的原型用于整合两者。这产生了直观的、基于实例的解释,且尊重声学属性,相比标准的基于梯度的方法提供了更高的语义清晰度。

关键词

引用

@article{arxiv.2605.10153,
  title  = {APEX: Audio Prototype EXplanations for Classification Tasks},
  author = {Piotr Kawa and Kornel Howil and Piotr Borycki and Miłosz Adamczyk and Przemysław Spurek and Piotr Syga},
  journal= {arXiv preprint arXiv:2605.10153},
  year   = {2026}
}