BadCLIP:面向 CLIP 后门攻击的触发感知提示学习
计算机视觉与模式识别
2024-03-25 v2
摘要
对比视觉-语言预训练(CLIP)在处理下游图像识别任务中展现出良好有效性。然而,近期工作揭示 CLIP 模型可被植入面向下游的后门。在下游任务上,受害模型在干净样本上表现良好,但一旦出现特定触发器便预测特定目标类别。为注入后门,现有攻击依赖大量额外数据对完整预训练 CLIP 模型进行恶意微调,这使其不适用于数据受限场景。本工作中,受可学习提示近期成功的启发,我们通过在提示学习阶段向 CLIP 模型注入后门来解决该问题。我们名为 BadCLIP 的方法构建于 CLIP 后门攻击中一种新颖且有效的机制,即利用触发器同时影响图像与文本编码器。它由一个应用于图像的可学习触发器与触发感知上下文生成器组成,使得触发器可通过触发感知提示改变文本特征,从而形成强大且可泛化的攻击。在 11 个数据集上的大量实验验证 BadCLIP 的干净准确率与先进提示学习方法相近,且攻击成功率在大多数情况下高于 99%。BadCLIP 还可泛化至未见类别,并在跨数据集与跨域设定下展现出强泛化能力。
引用
@article{arxiv.2311.16194,
title = {BadCLIP: Trigger-Aware Prompt Learning for Backdoor Attacks on CLIP},
author = {Jiawang Bai and Kuofeng Gao and Shaobo Min and Shu-Tao Xia and Zhifeng Li and Wei Liu},
journal= {arXiv preprint arXiv:2311.16194},
year = {2024}
}
备注
14 pages, 6 figures