鲁棒可迁移特征提取器:学习防御预训练网络抵御白盒对手
机器学习
2022-09-16 v1 人工智能
密码学与安全
机器学习
摘要
深度神经网络在计算机视觉应用中的广泛采用引发了人们对对抗鲁棒性的浓厚兴趣。已有研究表明,针对给定模型专门构造的恶意扰动输入(即对抗样本)可成功迁移至另一独立训练的模型以引发预测错误。此外,对抗样本的这一性质被归因于数据分布中由预测模式导出的特征。因此,我们受启发去探究如下问题:对抗防御能否像对抗样本一样成功迁移至其他独立训练的模型?为此,我们提出一种基于深度学习的预处理机制,称之为鲁棒可迁移特征提取器(RTFE)。在考察理论动机与含义后,我们通过实验表明,我们的方法可为多个独立预训练的分类器提供对抗鲁棒性,而这些分类器原本对自适应白盒对手无效。进一步,我们展示 RTFE 甚至能对在不同数据集上独立训练的模型提供一次性对抗鲁棒性。
引用
@article{arxiv.2209.06931,
title = {Robust Transferable Feature Extractors: Learning to Defend Pre-Trained Networks Against White Box Adversaries},
author = {Alexander Cann and Ian Colbert and Ihab Amer},
journal= {arXiv preprint arXiv:2209.06931},
year = {2022}
}