部分训练与隔离:缓解后门攻击
计算机视觉与模式识别
2024-06-07 v2
摘要
众所周知,神经网络容易受到后门攻击,这是一种通过污染部分训练数据,使目标模型在正常数据集上表现良好,同时在中毒样本上输出攻击者指定或随机类别的方法。后门攻击充满威胁。中毒样本与相应正常样本越来越相似,甚至人眼也难以轻易区分。另一方面,携带后门的模型在正常样本上的准确率与干净模型无异。在本文中,通过观察后门攻击的特征,我们提供了一种新的模型训练方法(PT),该方法冻结部分模型以训练一个能够隔离可疑样本的模型。然后,在此基础上,微调一个干净模型以抵抗后门攻击。
引用
@article{arxiv.2405.16488,
title = {Partial train and isolate, mitigate backdoor attack},
author = {Yong Li and Han Gao},
journal= {arXiv preprint arXiv:2405.16488},
year = {2024}
}
备注
9 pages, 2 figures