防御自监督学习中基于补丁的后门攻击
计算机视觉与模式识别
2023-04-05 v1
摘要
近期研究表明,自监督学习(SSL)易受基于补丁的数据投毒后门攻击。研究表明,攻击者可以投毒一小部分无标签数据,使得受害者在上面训练SSL模型时,最终模型会存在一个攻击者可利用的后门。本工作旨在防御此类攻击下的自监督学习。我们采用三步防御流程:首先在投毒数据上训练一个模型;第二步,我们提出的防御算法(PatchSearch)利用训练好的模型在训练数据中搜索投毒样本并将其从训练集中移除;第三步,在清理后的训练集上训练最终模型。我们的结果表明PatchSearch是一种有效的防御。例如,它将模型在含触发器的图像上的准确率从38.2%提升至63.7%,非常接近干净模型的准确率64.6%。此外,我们展示PatchSearch优于基线及包括使用额外干净可信数据的最先进防御方法。我们的代码见 https://github.com/UCDvision/PatchSearch
引用
@article{arxiv.2304.01482,
title = {Defending Against Patch-based Backdoor Attacks on Self-Supervised Learning},
author = {Ajinkya Tejankar and Maziar Sanjabi and Qifan Wang and Sinong Wang and Hamed Firooz and Hamed Pirsiavash and Liang Tan},
journal= {arXiv preprint arXiv:2304.01482},
year = {2023}
}
备注
Accepted to CVPR 2023