音频分类中局部、模型无关解释的真实可靠性:基于对抗样本的针对性研究
音频与语音处理
2021-09-07 v2 人工智能
声音
摘要
LIME 等局部解释方法已成为音乐信息检索(MIR)中生成模型分类决策的事后、模型无关解释的热门工具。其基本思想是识别被分类样本中一组少量人类可理解的特征,这些特征对分类器预测影响最大,并将其作为解释呈现。相关论文中对这类解释的评估往往诉诸于接受符合人类预期的内容,却无法实际验证解释所展示的是否真正导致了模型的预测。本文报道了针对性研究,试图更深入理解音频分类任务中 LIME 解释的实际真实性。我们为分类器刻意设计对抗样本,使得我们能够知晓输入的哪些部分可能负责模型(错误)预测。要求 LIME 解释这些对抗样本的预测,使我们能够研究局部解释是否确实检测到这些感兴趣区域。我们还考察 LIME 是否更成功地找到对人类更显著且易察觉的扰动。我们的结果表明,LIME 未必能识别最相关的输入特征,因此解释是否有用甚至具有误导性仍不清楚。
引用
@article{arxiv.2107.09045,
title = {On the Veracity of Local, Model-agnostic Explanations in Audio Classification: Targeted Investigations with Adversarial Examples},
author = {Verena Praher and Katharina Prinz and Arthur Flexer and Gerhard Widmer},
journal= {arXiv preprint arXiv:2107.09045},
year = {2021}
}
备注
8 pages, 4 figures, to be published in Proceedings of the International Society for Music Information Retrieval Conference 2021 (ISMIR 2021)