中文

VLMShield:面向恶意提示的视觉-语言模型高效鲁棒防御

机器学习 2026-04-09 v1

摘要

视觉-语言模型(VLM)因在视觉集成期间的对齐减弱,面临来自恶意提示攻击的显著安全漏洞。现有防御方法在效率和鲁棒性方面存在不足。为此,我们首先提出多模态聚合特征提取(MAFE)框架,使 CLIP 能够处理长文本并将多模态信息融合为统一表示。通过对 MAFE 提取特征的实证分析,我们发现良性和恶意提示之间存在不同的分布模式。基于这一发现,我们开发了 VLMShield,一个轻量级安全检测器,高效识别多模态恶意攻击,作为即插即用的解决方案。大量实验表明,该方法在多个维度(鲁棒性、效率和实用性)上表现出优异性能。通过本工作,我们希望为更安全的多模态 AI 部署铺平道路。代码已公开于 [this https URL](https://github.com/pgqihere/VLMShield)。

引用

@article{arxiv.2604.06502,
  title  = {VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts},
  author = {Peigui Qi and Kunsheng Tang and Yanpu Yu and Jialin Wu and Yide Song and Wenbo Zhou and Zhicong Huang and Cheng Hong and Weiming Zhang and Nenghai Yu},
  journal= {arXiv preprint arXiv:2604.06502},
  year   = {2026}
}