中文

基于均匀平滑归因的认证 ℓ₂ 归因鲁棒性

机器学习 2024-05-13 v1

摘要

模型归因是解释模型预测背后原理的常用工具。然而,近期研究表明,归因对微小扰动很脆弱,这些扰动可被添加到输入样本中以欺骗归因,同时维持预测输出不变。尽管实证研究已通过对抗训练显示出积极性能,但迫切需要一种有效的认证防御方法来理解归因的鲁棒性。在本文中,我们提出使用均匀平滑技术,通过从特定空间中均匀采样的噪声来增强原始归因。我们证明,对于攻击区域内的所有扰动,受扰动样本的均匀平滑归因与未受扰动样本的归因之间的余弦相似度保证具有下界。我们还推导了该认证的替代公式,其与原始公式等价,并提供了扰动无法改变归因的最大扰动尺寸或最小平滑半径。我们在三个数据集上评估了所提出的方法,结果表明,无论网络架构、训练方案和数据集大小如何,该方法都能有效保护归因免受攻击。

关键词

引用

@article{arxiv.2405.06361,
  title  = {Certified $\ell_2$ Attribution Robustness via Uniformly Smoothed Attributions},
  author = {Fan Wang and Adams Wai-Kin Kong},
  journal= {arXiv preprint arXiv:2405.06361},
  year   = {2024}
}