中文

通过不安全权重操作实现安全的视觉-语言模型

计算机视觉与模式识别 2026-01-13 v2 人工智能

摘要

视觉-语言模型(VLM)通常继承其大规模训练数据集中存在的偏见和不安全关联。尽管近期的方法缓解了不安全行为,但其评估侧重于模型在不安全输入上的安全性,却忽略了在安全输入上可能存在的缺陷。在本文中,我们首先通过引入 SafeGround 来修订安全性评估,这是一组在不同粒度级别评估安全性的新指标。借助该指标,我们发现基于训练的方法存在一个令人惊讶的问题:它们会降低模型在安全输入上的安全性。基于这一发现,我们采取了不同的方向,探讨是否可以在不进行训练的情况下使模型变得更安全,从而引入了不安全权重操作(UWM)。UWM 使用由安全和不安全实例组成的校准集来比较安全内容和不安全内容之间的激活,从而识别出处理后者最重要的参数。然后通过取反操作来调整这些参数的值。实验表明,UWM 在安全性和知识保留之间取得了最佳权衡,在 unsafe queries 上持续改进 VLM,同时在 safe queries 上甚至优于基于训练的 state-of-the-art 方法。

关键词

引用

@article{arxiv.2503.11742,
  title  = {Safe Vision-Language Models via Unsafe Weights Manipulation},
  author = {Moreno D'Incà and Elia Peruzzo and Xingqian Xu and Humphrey Shi and Nicu Sebe and Massimiliano Mancini},
  journal= {arXiv preprint arXiv:2503.11742},
  year   = {2026}
}

备注

WACV 2026