中文

PurSAMERE:通过最小化预期重构误差的锐度感知来实现可靠对抗净化

机器学习 2026-02-09 v1 最优化与控制 概率论

摘要

我们提出了一种新型确定性净化方法,以提高对抗鲁健性,通过将可能的对抗样本映射到靠近数据分布模式的附近样本,分类器在此处更可靠。我们设计该方法为确定性,以确保可靠的测试准确率,防止对抗者完全了解系统及其随机性时所观察到的有效鲁健性下降。我们采用通过最小化噪声损坏数据的预期重构误差训练的评分模型,从而学习输入数据分布的结构特征。给定可能的对抗输入后,方法在其局部邻域内搜索,以最小化噪声损坏下的预期重构误差的净化样本,然后将该净化样本输入分类器。在净化过程中,使用锐度感知最小化引导净化样本朝向预期重构误差景观的平坦区域,从而增强鲁健性。我们进一步表明,随着噪声水平降低,最小化预期重构误差会偏向高斯平滑密度的局部最大化器;在评分模型的额外局部假设下,我们在小噪声极限下证明了局部最大化器的恢复。实验结果显示,在强大的确定性白盒攻击下,PurSAMERE 在对抗鲁健性方面显著优于最先进的方法。

关键词

引用

@article{arxiv.2602.06269,
  title  = {PurSAMERE: Reliable Adversarial Purification via Sharpness-Aware Minimization of Expected Reconstruction Error},
  author = {Vinh Hoang and Sebastian Krumscheid and Holger Rauhut and Raúl Tempone},
  journal= {arXiv preprint arXiv:2602.06269},
  year   = {2026}
}