用于模型可解释性的正则化对抗样本
机器学习
2018-11-22 v2 密码学与安全
计算机视觉与模式识别
机器学习
摘要
随着机器学习算法的持续改进,对于解释模型为何针对特定输入产生特定预测的需求日益增长。近年来,已开发出若干模型可解释性方法,旨在解释模型输入的哪些子集区域是模型预测的主要原因。与此同时,近年来一个重要的研究群体致力于开发对抗样本生成方法以欺骗模型,同时不改变输入的真实标签(如人类标注者所分类的那样)。本文中,我们弥合对抗样本生成与模型可解释性之间的鸿沟,并对对抗样本生成过程引入一种改进以促使更好的可解释性。我们在一个公开医学影像数据集上对所提方法进行了定量与定性分析,表明其显著优于已知的领先替代方法。我们建议的方法易于实现,并可轻松嵌入大多数常见对抗样本生成框架。此外,我们提出一种解释质量度量——(“对抗扰动解释”,Adversarial Perturbative Explanation),用于衡量解释描述模型决策的好坏程度。
引用
@article{arxiv.1811.07311,
title = {Regularized adversarial examples for model interpretability},
author = {Yoel Shoshan and Vadim Ratner},
journal= {arXiv preprint arXiv:1811.07311},
year = {2018}
}