中文

如其根基般坚固:开源基础模型能否被用于针对下游任务生成对抗样本?

计算机视觉与模式识别 2024-03-20 v1

摘要

在网络规模视觉-语言数据上预训练的基础模型(如 CLIP)被广泛用作强大机器学习系统的基石。虽然预训练为下游学习带来了明显优势,但它也使下游模型共享对抗性漏洞,这些漏洞可通过开源基础模型轻易识别。在本工作中,我们揭示了 CLIP 下游模型中的此类漏洞,并证明基础模型可作为攻击其下游系统的依据。具体而言,我们提出了一种简单而有效的对抗攻击策略,称为补丁表征错位(Patch Representation Misalignment, PRM)。该方法仅基于开源 CLIP 视觉编码器,即可生成同时欺骗超过 20 个下游模型的对抗样本,涵盖 4 种常见的视觉-语言任务(语义分割、目标检测、图像描述生成和视觉问答)。我们的研究结果凸显了在下游系统开发中广泛使用公共基础模型所带来的令人担忧的安全风险,呼吁在这些场景中保持额外的警惕。

关键词

引用

@article{arxiv.2403.12693,
  title  = {As Firm As Their Foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?},
  author = {Anjun Hu and Jindong Gu and Francesco Pinto and Konstantinos Kamnitsas and Philip Torr},
  journal= {arXiv preprint arXiv:2403.12693},
  year   = {2024}
}