通用对抗方向
机器学习
2023-04-18 v2 人工智能
密码学与安全
机器学习
摘要
尽管深度神经网络(DNNs)在图像识别任务中取得了巨大成功,但已被观察到易受通用对抗扰动(UAPs)的影响,后者以单一扰动向量扰动所有输入样本。然而,UAPs 常难以在不同 DNN 架构间迁移,并导致困难的优化问题。本工作中,我们通过分析分类器与 UAP 对抗玩家之间通用对抗样本博弈的均衡来研究 UAPs 的迁移性。我们表明,在温和假设下通用对抗样本博弈缺乏纯纳什均衡,表明 UAPs 跨 DNN 分类器的次优迁移性。为解决此问题,我们提出通用对抗方向(UADs),其仅固定对抗扰动的通用方向,并允许扰动幅度跨样本自由选取。我们证明 UAD 对抗样本博弈可拥有带纯 UAD 策略的纳什均衡,意味着 UADs 的潜在迁移性。我们还将 UAD 优化问题与主成分分析(PCA)相关联,并开发了基于 PCA 的高效算法来优化 UADs。我们在多个基准图像数据集上评估 UADs。数值结果显示 UADs 相对于标准基于梯度的 UAPs 具有优越的迁移性。
引用
@article{arxiv.2210.15997,
title = {Universal Adversarial Directions},
author = {Ching Lam Choi and Farzan Farnia},
journal= {arXiv preprint arXiv:2210.15997},
year = {2023}
}