论解释的不忠度与灵敏度
机器学习
2019-11-05 v4 机器学习
摘要
我们考虑针对复杂黑盒机器学习模型显著性解释的客观评估度量。我们提出了近期文献中两个概念——(不)忠度与灵敏度——的简单鲁棒变体。我们分析了关于这两个度量的优化解释,其中灵敏度的最优解释是一种空洞的常数解释,而不忠度的最优解释是两种流行解释方法的全新组合。通过改变定义不忠度的扰动分布,我们通过优化不忠度获得了新的解释,并表明其在定量与定性度量上均优于已有解释。给定这些度量,另一个突出问题是如何修改任意给定解释以在这些度量上获得更好取值。我们提出了一种基于降低灵敏度的简单修改,并进一步表明若恰当执行,可同时改善灵敏度与忠度。
引用
@article{arxiv.1901.09392,
title = {On the (In)fidelity and Sensitivity for Explanations},
author = {Chih-Kuan Yeh and Cheng-Yu Hsieh and Arun Sai Suggala and David I. Inouye and Pradeep Ravikumar},
journal= {arXiv preprint arXiv:1901.09392},
year = {2019}
}
备注
NeurIPS 2019 camera ready, previous version on Arxiv: "How Sensitive are Sensitivity-Based Explanations"