c-Eval:一种基于扰动的统一度量以评估基于特征的解释
机器学习
2020-08-12 v2 机器学习
摘要
在许多现代图像分类应用中,理解模型预测的原因可能与预测本身的准确性同样关键。各种基于特征的局部解释生成方法被设计用来让我们更深入了解决策复杂的分类器。然而,在评估不同解释的质量方面尚无共识。针对这一缺乏综合评估的现状,我们引入 c-Eval 度量及其相应框架,以量化基于特征的局部解释的质量。给定分类器的预测及该预测对应的解释,c-Eval 是在保持解释特征不变的同时成功改变预测所需的最小失真扰动。随后我们展示如何通过对现有对抗生成库做些修改来计算 c-Eval。为表明 c-Eval 捕捉了输入特征的重要性,我们建立了 c-Eval 与仿射及近仿射分类器中解释器返回特征之间的联系。接着我们引入 c-Eval 图,其不仅显示了 c-Eval 与解释器质量间的强关联,还有助于自动确定解释器参数。由于 c-Eval 的生成依赖于对抗生成,我们给出了 c-Eval 在对抗鲁棒模型上的演示,并表明该度量适用于这些模型。最后,我们在不同数据集上进行了广泛的解释器实验,以支持采用 c-Eval 评估解释器性能。
引用
@article{arxiv.1906.02032,
title = {c-Eval: A Unified Metric to Evaluate Feature-based Explanations via Perturbation},
author = {Minh N. Vu and Truc D. Nguyen and NhatHai Phan and Ralucca Gera and My T. Thai},
journal= {arXiv preprint arXiv:1906.02032},
year = {2020}
}