毒化半监督学习的无标签数据集
机器学习
2021-08-11 v2 密码学与安全
计算机视觉与模式识别
摘要
半监督机器学习模型从一(小)组带标签训练样本和一(大)组无标签训练样本中学习。最先进的模型在仅需要 1/100 标签数据的情况下,可达到全监督训练几个百分点以内的精度。我们研究一类新的漏洞:修改无标签数据集的投毒攻击。为了具备实用性,无标签数据集受到的审查远比带标签数据集严格更少,因此对手可轻易对其投毒。通过仅插入占数据集规模 0.1% 的恶意构造无标签样本,我们就能操纵在该中毒数据集上训练的模型在测试时将任意样本误分类(为任意期望标签)。我们的攻击在各类数据集与半监督学习方法上均高度有效。我们发现更准确的方法(因而更可能被使用)对投毒攻击显著更脆弱,因此更好的训练方法不太可能阻止此类攻击。为应对此问题,我们探索防御空间并提出两种缓解我们攻击的方法。
引用
@article{arxiv.2105.01622,
title = {Poisoning the Unlabeled Dataset of Semi-Supervised Learning},
author = {Nicholas Carlini},
journal= {arXiv preprint arXiv:2105.01622},
year = {2021}
}