中文

超越可解释性:利用可解释性改进对抗学习

机器学习 2019-04-23 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

在本研究中,我们提出将可解释性用于纯粹可解释性目的之外的任务。具体而言,本研究提出一种在对抗样本领域利用基于梯度的可解释性的新策略,其中我们使用所获得的洞见来辅助对抗学习。更具体地,我们引入空间约束单像素对抗扰动的概念,将此类对抗扰动的学习引导至通过基于梯度的可解释性识别出的更易受攻击区域。使用不同基准数据集的实验结果表明,这种空间约束单像素对抗扰动策略可显著提升收敛速度,并产生成功的、在视觉上亦难以察觉的攻击,从而展示了可解释性方法在纯粹可解释性目的之外任务中的有效应用。

关键词

引用

@article{arxiv.1904.09633,
  title  = {Beyond Explainability: Leveraging Interpretability for Improved Adversarial Learning},
  author = {Devinder Kumar and Ibrahim Ben-Daya and Kanav Vats and Jeffery Feng and Graham Taylor and and Alexander Wong},
  journal= {arXiv preprint arXiv:1904.09633},
  year   = {2019}
}

备注

CVPR 2019 XAI Workshop accepted