中文

基于 Renyi 差分隐私的可证明鲁棒解释

机器学习 2021-07-06 v1 机器学习

摘要

受近期发现的 CNN 解释图易遭受针对网络可解释性的对抗攻击操纵的启发,我们从 Renyi 差分隐私(RDP)这一新角度研究解释鲁棒性问题。我们提出的 Renyi-Robust-Smooth(基于 RDP 的解释方法)具有三重优势。首先,它能提供可证明且可认证的 top-kk 鲁棒性。即在任意具有有界 d\ell_d 范数(对任意 d1d\geq 1,包括 d=d = \infty)的输入扰动下,解释图的 top-kk 重要归因可证明是鲁棒的。其次,我们提出的方法在 top-kk 归因方面比现有方法提供约 10%10\% 更好的实验鲁棒性。值得注意的是,Renyi-Robust-Smooth 的准确率也优于现有方法。第三,我们的方法能在鲁棒性与计算效率之间提供平滑的权衡。实验上,在计算资源高度受限时,其 top-kk 归因的鲁棒性是现有方法的两倍。

关键词

引用

@article{arxiv.2107.01561,
  title  = {Certifiably Robust Interpretation via Renyi Differential Privacy},
  author = {Ao Liu and Xiaoyu Chen and Sijia Liu and Lirong Xia and Chuang Gan},
  journal= {arXiv preprint arXiv:2107.01561},
  year   = {2021}
}

备注

19 page main text + appendix