中文

安全幻象:虚假关联如何削弱视觉语言模型的安全微调及其通过机器遗忘的缓解方法

人工智能 2026-03-06 v4 机器学习

摘要

最近的视觉语言模型 (VLM) 在多模态输入(尤其是文本和图像)的生成式建模方面取得了显著进展。然而,它们对生成有害内容的脆弱性引发了关键安全担忧。虽然当前的对齐策略主要依赖于带有精选数据集的监督式安全微调,但我们识别出一种根本性局限,我们称之为''安全幻象'',即监督式微调不慎强化了文本模式与安全响应之间的虚假关联,而非培养深层、内在的危害缓解。我们表明,这些虚假关联即使对 VLMs 进行仅修改一个单词的攻击性查询也会削弱其防御。此外,这些关联导致 VLMs 过度谨慎,错误地拒绝了本应被接受的查询。为解决这些问题,我们表明机器遗忘 (MU) 作为监督式安全微调的强大替代方案,因其避免了偏好特征-标签映射,能够直接从 VLMs 中移除有害知识,同时保留其通用能力。广泛的安全基准评估显示,基于 MU 的对齐可将攻击成功率降低最高可达 60.27%,并将不必要的拒绝率降低超过 84.20%。

关键词

引用

@article{arxiv.2503.11832,
  title  = {Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning},
  author = {Yiwei Chen and Yuguang Yao and Yihua Zhang and Bingquan Shen and Gaowen Liu and Sijia Liu},
  journal= {arXiv preprint arXiv:2503.11832},
  year   = {2026}
}