DAVSP:通过深度对齐视觉安全提示实现大视觉语言模型的安全性对齐
密码学与安全
2025-11-18 v3 计算机视觉与模式识别
摘要
大视觉语言模型(LVLMs)在各种应用中取得了令人瞩目的进展,但仍然容易受到利用视觉模态的恶意查询的攻击。现有的对齐方法通常既无法有效抵御恶意查询,又难以在良性查询上保持效用。为了解决这些挑战,我们提出了深度对齐视觉安全提示(DAVSP),其基于两项关键创新。首先,我们引入了视觉安全提示(Visual Safety Prompt),它在输入图像周围附加一个可训练的填充区域。它保留了视觉特征并扩展了优化空间。其次,我们提出了深度对齐(Deep Alignment),这是一种通过模型激活空间中的监督来训练视觉安全提示的新方法。它增强了LVLMs感知恶意查询的固有能力,实现了比先前工作更深层次的对齐。在两个代表性LVLMs上的五个基准测试上的大量实验表明,DAVSP能够有效抵御恶意查询,同时保持良性输入的效用。此外,DAVSP展现出出色的跨模型生成能力。消融研究进一步揭示,视觉安全提示和深度对齐都是必不可少的组成部分,共同贡献于其整体有效性。代码已公开发布,地址为 https://github.com/zhangyitonggg/DAVSP。
引用
@article{arxiv.2506.09353,
title = {DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt},
author = {Yitong Zhang and Jia Li and Liyi Cai and Ge Li},
journal= {arXiv preprint arXiv:2506.09353},
year = {2025}
}
备注
16 pages