中文

关于深度神经网络模型解释的鲁棒性:一项综述

机器学习 2022-11-10 v1 密码学与安全 计算机视觉与模式识别

摘要

可解释性被广泛认为是负责任且可信地使用机器学习模型的基石。随着深度神经网络(DNN)模型在风险敏感与安全关键领域的普遍应用,许多解释这些模型决策的方法被提出。近年来亦有协同努力表明此类解释如何被微小输入扰动扭曲(攻击)。尽管已有诸多综述回顾可解释性方法本身,但迄今尚无工作系统梳理为研究 DNN 模型解释鲁棒性而提出的各类方法与度量。本工作中,我们呈现一项关于研究、理解、攻击及防御 DNN 模型解释方法的全面综述。我们还详细回顾了用于评估解释方法的不同度量,并描述了归因攻击与防御方法。最后,我们为社区总结确保 DNN 模型预测具有鲁棒解释的经验与启示。

关键词

引用

@article{arxiv.2211.04780,
  title  = {On the Robustness of Explanations of Deep Neural Network Models: A Survey},
  author = {Amlan Jyoti and Karthik Balaji Ganesh and Manoj Gayala and Nandita Lakshmi Tunuguntla and Sandesh Kamath and Vineeth N Balasubramanian},
  journal= {arXiv preprint arXiv:2211.04780},
  year   = {2022}
}

备注

Under Review ACM Computing Surveys "Special Issue on Trustworthy AI"