检测预训练编码器中的后门
计算机视觉与模式识别
2023-03-28 v1 人工智能
密码学与安全
摘要
计算机视觉中的自监督学习在未经标注的数据(如图像或(图像,文本)对)上训练,以获得对输入数据学习高质量嵌入的图像编码器。针对编码器的新兴后门攻击暴露了自监督学习的关键漏洞,因为下游分类器(即使在干净数据上进一步训练)可能从编码器继承后门行为。现有的后门检测方法主要关注监督学习设置,无法处理预训练编码器,尤其是在输入标签不可用时。本文提出DECREE,首个面向预训练编码器的后门检测方法,既不需要分类器头也不需要输入标签。我们在超过400个于3种范式下植入木马的编码器上评估DECREE。我们展示了该方法在ImageNet和OpenAI的CLIP四亿图像-文本对上预训练的图像编码器上的有效性。即使我们仅能有限或无法访问预训练数据集,我们的方法也始终保持高检测准确率。
引用
@article{arxiv.2303.15180,
title = {Detecting Backdoors in Pre-trained Encoders},
author = {Shiwei Feng and Guanhong Tao and Siyuan Cheng and Guangyu Shen and Xiangzhe Xu and Yingqi Liu and Kaiyuan Zhang and Shiqing Ma and Xiangyu Zhang},
journal= {arXiv preprint arXiv:2303.15180},
year = {2023}
}
备注
Accepted at CVPR 2023. Code is available at https://github.com/GiantSeaweed/DECREE