少许鲁棒性大有裨益:利用鲁棒特征实现定向迁移攻击
机器学习
2021-10-27 v2 密码学与安全
摘要
已知神经网络图像分类器的对抗样本具有可迁移性:为被源分类器误分类而优化的样本,常也被具有不同架构的分类器误分类。然而,定向对抗样本——优化为被分类为选定目标类别的样本——在不同架构间的可迁移性往往较低。先前关于构建可迁移定向攻击的研究集中于改进优化过程,而本工作考察源分类器的作用。我们在此表明,将源分类器训练为“轻微鲁棒”——即对小幅值对抗样本鲁棒——可大幅提升类定向与表示定向对抗攻击的迁移性,即便在如卷积神经网络与 transformer 般迥异的架构之间亦如此。我们所呈现的结果增进了对对抗样本本质以及所谓“鲁棒”分类器背后机制的理解。
引用
@article{arxiv.2106.02105,
title = {A Little Robustness Goes a Long Way: Leveraging Robust Features for Targeted Transfer Attacks},
author = {Jacob M. Springer and Melanie Mitchell and Garrett T. Kenyon},
journal= {arXiv preprint arXiv:2106.02105},
year = {2021}
}
备注
NeurIPS '21