对抗攻击是毒化少样本元学习器一个出奇强劲的基线
机器学习
2022-11-24 v1 密码学与安全
摘要
本文考察了已部署的少样本元学习系统在输入一个不可感知扰动的少样本数据集时的鲁棒性。我们攻击摊还式元学习器,这使我们能够精心构造协同作祟的输入集合,当用作训练数据时专门用来愚弄系统的学习算法。联合构造的对抗输入可能预期会协同操纵分类器,从而实现难以检测的极强数据投毒攻击。我们表明,在白盒设定下这些攻击非常成功,并能使目标模型的预测变得比随机更差。然而,与众所周知的对抗样本的一般可迁移性相反,这些协同集合并不能很好地迁移到不同分类器上。我们探讨两种假设来解释这一点:攻击的“过拟合”,以及攻击所基于的模型与攻击所迁移到的模型之间的不匹配。无论这些假设所建议的缓解策略如何,协同输入的迁移性并不比以通常方式独立生成的对抗输入更好。
引用
@article{arxiv.2211.12990,
title = {Adversarial Attacks are a Surprisingly Strong Baseline for Poisoning Few-Shot Meta-Learners},
author = {Elre T. Oldewage and John Bronskill and Richard E. Turner},
journal= {arXiv preprint arXiv:2211.12990},
year = {2022}
}
备注
Accepted at I Can't Believe It's Not Better Workshop, Neurips 2022