破坏深度神经网络中的对抗迁移性
机器学习
2023-02-24 v3 人工智能
密码学与安全
摘要
对抗攻击的迁移性在深度学习中已被广泛认知。先前的工作通过识别共同的对抗子空间与决策边界之间的相关性对其进行了部分解释,但除此以外知之甚少。我们提出,看似不同的模型之间的迁移性源于不同网络所提取特征集之间的高线性相关性。换言之,在同一任务上训练、在参数空间中相距甚远的两个模型很可能以相同方式提取特征,仅在其潜空间之间存在平凡的仿射变换。此外,我们展示了应用特征相关损失(该损失在潜空间中去相关所提取的特征)如何能够降低对抗攻击在模型间的迁移性,这表明模型以语义上不同的方式完成任务。最后,我们提出了双颈自编码器(Dual Neck Autoencoder, DNA),它利用该特征相关损失来创建两个语义上有意义且迁移性降低的输入信息编码。
引用
@article{arxiv.2108.12492,
title = {Disrupting Adversarial Transferability in Deep Neural Networks},
author = {Christopher Wiedeman and Ge Wang},
journal= {arXiv preprint arXiv:2108.12492},
year = {2023}
}
备注
20 pages, 13 figures