中文

鲁棒且稳定的黑盒解释

机器学习 2020-11-13 v1

摘要

随着机器学习黑盒日益部署于现实应用,人们对开发总结这些黑盒行为的后验解释兴趣渐增。然而,现有生成此类解释的算法已被证明缺乏稳定性且对分布偏移不鲁棒。我们提出了一种基于对抗训练生成黑盒模型鲁棒且稳定解释的新框架。我们的框架优化一个极小极大目标,旨在针对一组对抗扰动下最坏情况构建最高保真度的解释。我们通过设计所需的优化过程,将该算法实例化为线性模型和决策集形式的解释。据我们所知,本工作是首次尝试生成对一类具有实际意义的通用对抗扰动鲁棒的后验解释。在真实与合成数据集上的实验评估表明,我们的方法在不牺牲原始数据分布上保真度的前提下,大幅提升了解释的鲁棒性。

关键词

引用

@article{arxiv.2011.06169,
  title  = {Robust and Stable Black Box Explanations},
  author = {Himabindu Lakkaraju and Nino Arsov and Osbert Bastani},
  journal= {arXiv preprint arXiv:2011.06169},
  year   = {2020}
}