通过机器可检验概念统一模型可解释性与鲁棒性
人工智能
2020-07-03 v2 计算机与社会
机器学习
摘要
随着深度神经网络(DNNs)在越来越多应用中的采用,可解释性已成为这些模型的关键需求。在许多现实任务中,要求可解释性的主要原因之一是为了进而评估预测鲁棒性,其中不符合各自解释(如输入中概念的存在与否)的预测(即类标签)被视为不可靠。然而,大多数(即便不是全部)先前的解释一致性检验方法(如LIME、TCAV、显著图)需要大量人工干预,阻碍了其大规模部署。本文提出一种鲁棒性评估框架,其核心思想是使用机器可检验概念。我们的框架定义了大量DNN解释可基于的概念,并在测试时执行解释一致性检验以评估预测鲁棒性。两步均以自动化方式执行,无需任何人工干预,并可轻松扩展至具有极多类别的数据集。在真实数据集与人工调查上的实验表明,我们的框架能显著提升预测鲁棒性:被框架标记为鲁棒的预测具有显著更高的准确率,且对对抗扰动更鲁棒。
引用
@article{arxiv.2007.00251,
title = {Unifying Model Explainability and Robustness via Machine-Checkable Concepts},
author = {Vedant Nanda and Till Speicher and John P. Dickerson and Krishna P. Gummadi and Muhammad Bilal Zafar},
journal= {arXiv preprint arXiv:2007.00251},
year = {2020}
}
备注
22 pages, 12 figures, 11 tables