中文

保护视觉语言模型:消除高斯噪声在扰动型攻击中的漏洞

计算机视觉与模式识别 2025-08-05 v3

摘要

视觉语言模型(VLMs)通过融合视觉信息扩展了大语言模型(LLMs)的能力,但在处理噪声或损坏图像时仍然容易受到越狱攻击。尽管现有 VLMs 在训练时采用安全措施以缓解此类攻击,但与噪声增强视觉输入相关的漏洞被忽略了。本文识别出缺乏噪声增强训练导致关键安全缺口:许多 VLMs 对甚至简单的扰动(如高斯噪声)都高度敏感。为此,我们提出了 Robust-VLGuard,一个包含对齐/错位图像-文本对的多模态安全数据集,结合噪声增强微调以降低攻击成功率同时保持模型功能。针对更强的基于优化的视觉扰动攻击,我们提出了 DiffPure-VLM,利用扩散模型将对抗性扰动转换为类似高斯噪声的形式,从而可被经过噪声增强安全微调的 VLMs 抵御。实验结果表明,扩散模型的分布迁移特性与我们微调的 VLMs 良好匹配,显著降低了不同强度下的对抗性扰动。该数据集和代码已公开于 https://github.com/JarvisUSTC/DiffPure-RobustVLM。

关键词

引用

@article{arxiv.2504.01308,
  title  = {Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks},
  author = {Jiawei Wang and Yushen Zuo and Yuanjun Chai and Zhendong Liu and Yicheng Fu and Yichun Feng and Kin-Man Lam},
  journal= {arXiv preprint arXiv:2504.01308},
  year   = {2025}
}

备注

ICCV 2025