SAFARI:面向可解释性鲁棒性的通用高效评估
机器学习
2023-08-01 v4 人工智能
摘要
深度学习(DL)的可解释性是可信 AI 的障碍。尽管可解释 AI(XAI)界付出巨大努力,解释仍缺乏鲁棒性——不可区分的输入扰动可能导致不同的 XAI 结果。因此,给定一种 XAI 方法,评估 DL 可解释性的鲁棒性至关重要。本文中,我们指出最先进技术无法共同应对的几项挑战:i) 现有度量不全面;ii) XAI 技术高度异构;iii) 误解释通常为稀有事件。为应对这些挑战,我们引入两种黑盒评估方法,分别关注最坏情况解释差异与总体鲁棒性的概率性概念。采用带定制适应度函数的遗传算法(GA)求解约束优化以实现高效最坏情况评估。致力于估计稀有事件概率的子集模拟(SS)用于评估总体鲁棒性。实验表明我们方法的准确性、敏感性与效率优于最先进技术。最后,我们展示了方法的两种应用:对鲁棒 XAI 方法排序,以及选择训练方案以同时提升分类与解释鲁棒性。
引用
@article{arxiv.2208.09418,
title = {SAFARI: Versatile and Efficient Evaluations for Robustness of Interpretability},
author = {Wei Huang and Xingyu Zhao and Gaojie Jin and Xiaowei Huang},
journal= {arXiv preprint arXiv:2208.09418},
year = {2023}
}
备注
Accepted by the IEEE/CVF International Conference on Computer Vision 2023 (ICCV'23)