中文

抵御解释操纵的防御方法

机器学习 2021-11-09 v1 人工智能

摘要

可解释机器学习因提升了模型的透明度而受到越来越多的关注,这有助于机器学习在真实应用中获得信任。然而,近期研究表明解释方法易受操纵攻击,即我们可以在保持模型预测不变的同时轻易改变其解释。为解决该问题,已有一些工作致力于使用更稳定的解释方法或改变模型配置。在本工作中,我们从训练视角切入,提出一种称为解释对抗训练(Adversarial Training on EXplanations, ATEX)的新训练方案,以提升模型内在的解释稳定性,而无需依赖具体所用的解释方法。ATEX 不直接指定数据实例上的解释值,仅对模型预测施加约束,从而避免在优化中涉及二阶导。作为进一步讨论,我们还发现解释稳定性与模型的另一属性——暴露于对抗攻击的风险——密切相关。通过实验,除表明 ATEX 提升了模型抵御针对解释的操纵的鲁棒性外,它还带来了额外益处,包括平滑解释以及在应用于模型时提升对抗训练的效果。

关键词

引用

@article{arxiv.2111.04303,
  title  = {Defense Against Explanation Manipulation},
  author = {Ruixiang Tang and Ninghao Liu and Fan Yang and Na Zou and Xia Hu},
  journal= {arXiv preprint arXiv:2111.04303},
  year   = {2021}
}