基于 Renyi 差分隐私的可证明鲁棒解释
机器学习
2021-07-06 v1 机器学习
摘要
受近期发现的 CNN 解释图易遭受针对网络可解释性的对抗攻击操纵的启发,我们从 Renyi 差分隐私(RDP)这一新角度研究解释鲁棒性问题。我们提出的 Renyi-Robust-Smooth(基于 RDP 的解释方法)具有三重优势。首先,它能提供可证明且可认证的 top- 鲁棒性。即在任意具有有界 范数(对任意 ,包括 )的输入扰动下,解释图的 top- 重要归因可证明是鲁棒的。其次,我们提出的方法在 top- 归因方面比现有方法提供约 更好的实验鲁棒性。值得注意的是,Renyi-Robust-Smooth 的准确率也优于现有方法。第三,我们的方法能在鲁棒性与计算效率之间提供平滑的权衡。实验上,在计算资源高度受限时,其 top- 归因的鲁棒性是现有方法的两倍。
引用
@article{arxiv.2107.01561,
title = {Certifiably Robust Interpretation via Renyi Differential Privacy},
author = {Ao Liu and Xiaoyu Chen and Sijia Liu and Lirong Xia and Chuang Gan},
journal= {arXiv preprint arXiv:2107.01561},
year = {2021}
}
备注
19 page main text + appendix