APEX:面向分类任务的音频原型解释
声音
2026-05-12 v1 机器学习
摘要
可解释 AI(XAI)在图像分类领域取得了显著成功,但音频领域缺乏同样成熟的解决方案。现有方法将基于视觉的归因技术应用于频谱图,忽略了视觉信号与声学信号之间的根本差异。尽管原型推理具有潜力,但声学相似性依然呈多维特征。我们引入了 APEX(Audio Prototype EXplanations),一种用于解释预训练音频分类器的事后框架。关键的是,APEX 无需对原始主干网络进行微调,并严格保持输出不变性。APEX 将解释解耦为四个视角:基于方块的原型用于定位瞬态事件,基于时间的原型用于捕捉时域模式,基于频率的原型用于突出频带,以及基于时频的原型用于整合两者。这产生了直观的、基于实例的解释,且尊重声学属性,相比标准的基于梯度的方法提供了更高的语义清晰度。
引用
@article{arxiv.2605.10153,
title = {APEX: Audio Prototype EXplanations for Classification Tasks},
author = {Piotr Kawa and Kornel Howil and Piotr Borycki and Miłosz Adamczyk and Przemysław Spurek and Piotr Syga},
journal= {arXiv preprint arXiv:2605.10153},
year = {2026}
}