一种用于对抗训练的统一 Wasserstein 分布鲁棒性框架
机器学习
2022-03-01 v1 计算机视觉与模式识别
摘要
众所周知,深度神经网络(DNNs)易受对抗攻击,暴露了深度学习系统的严重脆弱性。因此,对抗训练(AT)方法通过在训练中引入对抗样本,成为增强基于 DNN 的分类器鲁棒性的自然且有效的途径。然而,大多数基于 AT 的方法,特别是 PGD-AT 和 TRADES,通常寻求逐点对手,通过独立扰动每个数据样本来生成最坏情况对抗样本,以此“探测”分类器的漏洞。可以说,从整个分布考虑此类对抗效应存在未探索的益处。为此,本文提出一个统一框架,将 Wasserstein 分布鲁棒性与当前最先进的 AT 方法相联系。我们引入新的 Wasserstein 代价函数和一系列新风险函数,并表明标准 AT 方法是我们框架中对应方法的特例。这一联系导致对现有 AT 方法的直观松弛与推广,并促进了一类新的基于分布鲁棒性 AT 算法的发展。大量实验表明,我们的分布鲁棒性 AT 算法在各种设定下进一步使其标准 AT 对应方法更鲁棒。
引用
@article{arxiv.2202.13437,
title = {A Unified Wasserstein Distributional Robustness Framework for Adversarial Training},
author = {Tuan Anh Bui and Trung Le and Quan Tran and He Zhao and Dinh Phung},
journal= {arXiv preprint arXiv:2202.13437},
year = {2022}
}