中文

生成确定性更低的对抗样本可改善鲁棒泛化

机器学习 2025-01-15 v4

摘要

本文重新审视对抗训练中的鲁棒过拟合现象。观察到具有更好鲁棒泛化性能的模型在预测对抗生成的训练输入时确定性更低,我们认为对对抗样本预测的过度自信是一个潜在原因。因此,我们假设生成确定性更低的对抗样本可改善鲁棒泛化,并提出捕获模型在对抗样本上预测 logits 方差的对抗确定性的形式化定义。我们对合成分布的理论分析刻画了对抗确定性与鲁棒泛化之间的联系。据此,基于对抗确定性的概念,我们开发了一种通用方法,用于搜索能够生成训练时确定性降低的对抗输入、同时保持模型区分对抗样本能力的模型。在图像基准上的大量实验表明,我们的方法有效学习到鲁棒性持续改进的模型并缓解了鲁棒过拟合,证实了生成确定性更低的对抗样本对鲁棒泛化的重要性。我们的实现作为开源代码发布于:https://github.com/TrustMLRG/AdvCertainty。

关键词

引用

@article{arxiv.2310.04539,
  title  = {Generating Less Certain Adversarial Examples Improves Robust Generalization},
  author = {Minxing Zhang and Michael Backes and Xiao Zhang},
  journal= {arXiv preprint arXiv:2310.04539},
  year   = {2025}
}

备注

Published in Transactions on Machine Learning Research (TMLR)