中文

通过投毒网络野图对半监督学习模型实施木马攻击

计算机与社会 2023-01-03 v1

摘要

网络上的野图易受后门(亦称木马)投毒攻击,导致在这些图像上学习的机器学习模型被注入后门。以往大多数攻击假设野图带有标签。然而现实中,网络上大多数图像是无标签的。具体而言,我们研究了在广泛研究的深度神经网络上,半监督学习(SSL)下无标签后门图像的影响。为贴近现实,我们假设攻击者为零知识(zero-knowledge),且半监督学习模型从零开始训练。首先,我们发现当被投毒的无标签图像来自不同类别时,后门投毒总是失败,这与有标签图像投毒不同。原因在于SSL算法在训练过程中总会努力纠正它们。因此,对于无标签图像,我们在目标类别的图像上实施后门投毒。接着,我们提出一种梯度匹配策略来制作投毒图像,使其梯度在SSL模型上与目标图像的梯度相匹配,从而将投毒图像拟合到目标类并实现后门注入。据我们所知,这可能是首个针对从零训练的SSL模型无标签图像的后门投毒方法。实验表明,我们的投毒在大多数SSL算法上达到了最先进的攻击成功率,同时绕过了现代后门防御。

关键词

引用

@article{arxiv.2301.00435,
  title  = {Trojaning semi-supervised learning model via poisoning wild images on the web},
  author = {Le Feng and Zhenxing Qian and Sheng Li and Xinpeng Zhang},
  journal= {arXiv preprint arXiv:2301.00435},
  year   = {2023}
}