主动迁移学习的对抗脆弱性
机器学习
2021-01-28 v1 密码学与安全
摘要
在小型数据集上训练有监督机器学习模型的两种广泛使用技术是主动学习(Active Learning)和迁移学习(Transfer Learning)。前者有助于在有限标注预算下最优地标注新数据。后者使用大型预训练模型作为特征提取器,并使得即使在微小数据集上也能设计复杂的非线性模型。在处理小型数据集时,结合这两种方法是一种有效的、最先进(state-of-the-art)的方法。在本文中,我们分享了一个有趣的观察:即这两种技术的组合特别容易受到一种新型数据投毒攻击:通过在输入上添加微小的对抗噪声,可以在迁移学习器的输出空间中制造冲突。结果,主动学习算法不再选择最优样本,而是几乎只选择攻击者注入的样本。这使得攻击者能够操纵主动学习器将任意图像选择并纳入数据集中,即使面对压倒性的未投毒样本多数。我们表明,在此类投毒数据集上训练的模型性能显著下降,测试准确率从86%降至34%。我们在音频和图像数据集上评估了该攻击,并以实证支持我们的发现。据我们所知,这一弱点在以往的文献中尚未被描述。
引用
@article{arxiv.2101.10792,
title = {Adversarial Vulnerability of Active Transfer Learning},
author = {Nicolas M. Müller and Konstantin Böttinger},
journal= {arXiv preprint arXiv:2101.10792},
year = {2021}
}
备注
Accepted for publication at IDA 2021