中文

部分训练与隔离:缓解后门攻击

计算机视觉与模式识别 2024-06-07 v2

摘要

众所周知,神经网络容易受到后门攻击,这是一种通过污染部分训练数据,使目标模型在正常数据集上表现良好,同时在中毒样本上输出攻击者指定或随机类别的方法。后门攻击充满威胁。中毒样本与相应正常样本越来越相似,甚至人眼也难以轻易区分。另一方面,携带后门的模型在正常样本上的准确率与干净模型无异。在本文中,通过观察后门攻击的特征,我们提供了一种新的模型训练方法(PT),该方法冻结部分模型以训练一个能够隔离可疑样本的模型。然后,在此基础上,微调一个干净模型以抵抗后门攻击。

关键词

引用

@article{arxiv.2405.16488,
  title  = {Partial train and isolate, mitigate backdoor attack},
  author = {Yong Li and Han Gao},
  journal= {arXiv preprint arXiv:2405.16488},
  year   = {2024}
}

备注

9 pages, 2 figures