ToxicTextCLIP:针对 CLIP 预训练的基于文本的投毒与后门攻击
计算机视觉与模式识别
2025-11-04 v1 密码学与安全
机器学习
摘要
对比语言-图像预训练(CLIP)模型通过自监督对比学习对齐来自大规模网络数据的图像-文本对,显著推进了视觉-语言建模。然而,其对未经筛选的互联网来源数据的依赖使其面临数据投毒和后门风险。虽然现有研究主要调查基于图像的攻击,但作为 CLIP 训练同样核心的文本模态仍未得到充分探索。在这项工作中,我们引入了 ToxicTextCLIP,一个用于在预训练阶段生成针对 CLIP 的高质量对抗性文本的框架。该框架解决了两个关键挑战:由与目标类别背景不一致引起的语义错位,以及背景一致文本的稀缺性。为此,ToxicTextCLIP 迭代地应用:1)一个背景感知选择器,优先选择背景内容与目标类别一致的文本;2)一个背景驱动的增强器,生成语义连贯且多样化的投毒样本。在分类和检索任务上的大量实验表明,ToxicTextCLIP 实现了高达 95.83% 的投毒成功率和 98.68% 的后门 Hit@1,同时绕过了 RoCLIP、CleanCLIP 和 SafeCLIP 防御。源代码可通过 https://github.com/xinyaocse/ToxicTextCLIP/ 访问。
引用
@article{arxiv.2511.00446,
title = {ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training},
author = {Xin Yao and Haiyang Zhao and Yimin Chen and Jiawei Guo and Kecheng Huang and Ming Zhao},
journal= {arXiv preprint arXiv:2511.00446},
year = {2025}
}
备注
Accepted by NeurIPS 2025