中文

语义盾牌:通过细粒度知识对齐防御视觉语言模型中的后门与投毒

计算机视觉与模式识别 2024-11-26 v1

摘要

近年来,针对自监督目标训练的视觉语言模型受到广泛关注。但大规模网络爬虞数据训练也使模型易受安全威胁,如后门攻击和投毒攻击。本文提出一种方法,用于缓解对对比训练视觉语言模型的攻击。我们的方法利用来自语言模型的外部知识,防止模型学习缺乏与外部知识强对齐的图像区域之间的关联。我们通过施加约束,强制模型对视觉区域注意力的分配与这些区域与外部知识的对齐程度成正比。我们在多个数据集和架构上针对各种近期后门和投毒攻击进行了广泛实验。结果清晰地表明,我们的方法在多个设置下对抗此类攻击具有高度有效性,同时保持模型实用性,且无需在推理时进行任何更改。

关键词

引用

@article{arxiv.2411.15673,
  title  = {Semantic Shield: Defending Vision-Language Models Against Backdooring and Poisoning via Fine-grained Knowledge Alignment},
  author = {Alvi Md Ishmam and Christopher Thomas},
  journal= {arXiv preprint arXiv:2411.15673},
  year   = {2024}
}

备注

CVPR 2024