解开大型视觉语言模型中的安全注意力头
机器学习
2025-01-07 v1 人工智能
密码学与安全
计算机视觉与模式识别
摘要
由于融合了额外的模态,大型视觉语言模型(LVLMs)比其仅语言的前身在安全风险(如越狱)方面更易受到攻击。尽管最近的研究致力于 LVLMs 的事后对齐,但其内部安全机制仍基本未被探索。本文我们发现 LVLMs 在生成第一个 token 时的内部激活可有效识别不同攻击中的恶意提示。这种内在的安全感知由稀疏注意力头控制,我们称为“安全头”。进一步分析表明,这些头作为针对恶意提示的专用护盾发挥作用;削弱它们会导致更高的攻击成功率,而模型的实用性则不受影响。通过定位这些安全头并拼接它们的激活,我们构建了一个简单但强大的恶意提示检测器,可无缝集成到生成过程中,额外推理开销最小。尽管其结构简单(仅使用 logistic 回归模型),但该检测器 surprisingly 展现出强大的零样本泛化能力。各种基于提示的攻击实验确认了利用安全头保护 LVLMs 的有效性。代码地址为 \url{https://github.com/Ziwei-Zheng/SAHs}。
引用
@article{arxiv.2501.02029,
title = {Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models},
author = {Ziwei Zheng and Junyao Zhao and Le Yang and Lijun He and Fan Li},
journal= {arXiv preprint arXiv:2501.02029},
year = {2025}
}