无需在泛化性上妥协的可证明无限制对抗训练
机器学习
2024-05-21 v2
摘要
对抗训练(AT)被广泛认为是抵御对抗攻击最有前景的策略,并引起了研究者越来越多的兴趣。然而,现有 AT 方法仍面临两个挑战。首先,它们无法处理无限制对抗样本(UAEs),后者是从零开始构建的,而非受限对抗样本(RAEs)那样通过在观测样本上添加受 范数约束的扰动来生成。其次,现有 AT 方法常以标准泛化性(即自然样本上的准确率)为代价来换取对抗鲁棒性,因为它们在二者间做了权衡。为克服这些挑战,我们提出一种独特视角,将 UAEs 理解为不可感知地扰动过的未观测样本。此外,我们发现该权衡源于对抗样本与自然样本分布的分离。基于这些想法,我们提出一种称为可证明无限制对抗训练(PUAT)的新颖 AT 方法,它能使目标分类器获得针对 UAE 和 RAE 的全面对抗鲁棒性,同时提升其标准泛化性。特别地,PUAT 利用部分标注数据,通过一种新颖的增广 triple-GAN 准确捕捉自然数据分布,从而实现有效的 UAE 生成。同时,PUAT 将目标分类器的监督损失引入对抗损失来扩展传统 AT,并在增广 triple-GAN 的协作下实现 UAE 分布、自然数据分布与分类器所学分布的对齐。最后,扎实的理论分析和在常用基准上的大量实验证明了 PUAT 的优越性。
引用
@article{arxiv.2301.09069,
title = {Provable Unrestricted Adversarial Training without Compromise with Generalizability},
author = {Lilin Zhang and Ning Yang and Yanchao Sun and Philip S. Yu},
journal= {arXiv preprint arXiv:2301.09069},
year = {2024}
}