中文

SafeEraser:通过多模态机器遗忘提升多模态大语言模型的安全性

计算机视觉与模式识别 2025-10-28 v6

摘要

随着多模态大语言模型(MLLMs)的发展,其潜在安全问题日益突出。机器遗忘(MU)作为一种有效的训练数据遗忘特定知识的策略,已被广泛用于隐私保护。然而,MLLMs的MU在安全方面尚未得到充分探索。为此,我们提出了SAFEERASER,一个针对MLLMs的安全遗忘基准,包含3000张图片和28.8K个VQA对。我们全面评估了从两个方面进行遗忘质量和模型实用性的遗忘方法。我们的发现表明,现有的MU方法在实施遗忘操作时难以维持模型性能,常常出现过度遗忘。因此,我们引入了Prompt Decouple(PD)损失,通过在遗忘过程中解耦提示来缓解过度遗忘。为量化PD损失缓解的过度遗忘,我们提出了一种新指标,即Safe Answer Refusal Rate(SARR)。实验结果表明,将PD损失与现有遗忘方法结合,可有效防止过度遗忘,在LLaVA-7B和LLaVA-13B的SARR指标上实现了79.5%的降低,同时保持遗忘质量和模型实用性。我们的代码和数据集将在接受后发布.警告:本文包含有害语言和图像的示例,建议读者自行判断。

关键词

引用

@article{arxiv.2502.12520,
  title  = {SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning},
  author = {Junkai Chen and Zhijie Deng and Kening Zheng and Yibo Yan and Shuliang Liu and PeiJun Wu and Peijie Jiang and Jia Liu and Xuming Hu},
  journal= {arXiv preprint arXiv:2502.12520},
  year   = {2025}
}