鼹鼠招募:通过选择性批次采样毒化图像分类器
机器学习
2023-03-31 v1
摘要
在这项工作中,我们提出一种数据投毒攻击,其在不对图像或标签做任何篡改的情况下混淆机器学习模型。这是通过简单利用训练数据本身中发现的最具混淆性的自然样本实现的,以一种被称为“鼹鼠招募”(Mole Recruitment)的新型针对性攻击形式。我们将鼹鼠定义为某一类中看起来与其他类样本最为相似的那部分训练样本,并表明仅以最优数量的鼹鼠重构训练批次即可导致目标类性能显著下降。我们在多个标准图像分类数据集的离线设置中展示了这一新颖攻击的有效性,并在持续学习(CL)设置中论证了该攻击在现实世界中的可行性。我们的分析揭示,最先进的模型易受鼹鼠招募攻击,从而暴露了图像分类器此前未被察觉的漏洞。
引用
@article{arxiv.2303.17080,
title = {Mole Recruitment: Poisoning of Image Classifiers via Selective Batch Sampling},
author = {Ethan Wisdom and Tejas Gokhale and Chaowei Xiao and Yezhou Yang},
journal= {arXiv preprint arXiv:2303.17080},
year = {2023}
}