中文

利用CLIPMasterPrints欺骗对比语言-图像预训练模型

计算机视觉与模式识别 2024-04-18 v3 人工智能 机器学习 神经与进化计算

摘要

利用视觉与文本数据的模型,如对比语言-图像预训练(CLIP),是许多近期人工智能进展的支柱。在本工作中,我们表明尽管此类模型用途广泛,却易受我们称之为欺骗主图像的攻击。欺骗主图像能够在大量差异显著的提示上最大化CLIP模型的置信度分数,而对人类而言要么无法辨识要么与所受攻击的提示无关。此类图像的存在是有问题的,因为恶意行为者可用其以较小代价恶意干扰生产环境中的CLIP训练图像检索模型,单张图像即可攻击许多不同提示。我们展示了如何使用随机梯度下降、投影梯度下降或黑盒优化来挖掘针对CLIP的欺骗主图像(CLIPMasterPrints)。与许多常见对抗攻击相反,黑盒优化方法使我们即便在模型权重不可访问时也能挖掘CLIPMasterPrints。我们研究了所挖掘图像的性质,发现基于少量图像描述训练的图像可泛化至数量大得多的语义相关描述。我们评估了可能的缓解策略,其中增强了模型鲁棒性并引入一种自动检测CLIPMasterPrints以净化易受攻击模型输入的方法。最后,我们发现对CLIPMasterPrints的脆弱性与对比预训练多模态网络中的模态鸿沟有关。代码见 https://github.com/matfrei/CLIPMasterPrints。

关键词

引用

@article{arxiv.2307.03798,
  title  = {Fooling Contrastive Language-Image Pre-trained Models with CLIPMasterPrints},
  author = {Matthias Freiberger and Peter Kun and Christian Igel and Anders Sundnes Løvlie and Sebastian Risi},
  journal= {arXiv preprint arXiv:2307.03798},
  year   = {2024}
}

备注

This work was supported by a research grant (40575) from VILLUM FONDEN