SGM:通过神经水平消毒为多模态大语言模型提供安全护目镜
计算与语言
2026-02-16 v3 人工智能
摘要
免责声明:本文中的样本可能有害且造成不适。多模态大语言模型 (MLLM) 能够实现多模态生成,但继承了来自弱ly 精选预训练语料库中带有毒性、偏见及 NSFW 信号的风险,在对抗触发器下尤其容易产生安全隐患,晚期、不透明的无训练消毒方法难以应对。我们提出 SGM,一种白盒神经水平的多模态干预措施,类似安全护目镜,可选择性地通过专业加权软抑制对一小组有毒专家神经元进行校准,从而在不进行任何参数更新的情况下中和有害的跨模态激活。我们建立了 MM-TOXIC-QA,一个多模态毒性评估框架,并将 SGM 与现有消毒技术进行比较。实验表明,SGM 在标准和对抗条件下均能有效缓解毒性,将有害率从 48.2% 降至 2.5%,同时保持流畅度和多模态推理能力。SGM 可扩展,其组合防御(称为 SGM*)可与现有消毒方法集成,以实现更强的安全性能,为可控的多模态生成提供一种可解释且低成本的解决方案。
引用
@article{arxiv.2512.15052,
title = {SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification},
author = {Hongbo Wang and MaungMaung AprilPyone and Isao Echizen},
journal= {arXiv preprint arXiv:2512.15052},
year = {2026}
}