单图像遗忘:多模态大语言模型中的高效机器遗忘
计算机视觉与模式识别
2025-03-31 v3 人工智能
摘要
机器遗忘通过移除机器学习模型中编码的私人或敏感信息,赋予个人“被遗忘的权利”。然而,目前尚不确定机器遗忘(MU)能否有效应用于多模态大语言模型,特别是在遗忘概念泄露的视觉数据场景中。为了克服这一挑战,我们提出了一种高效的方法——单图像遗忘(SIU),通过对单张关联图像进行几个步骤的微调,来遗忘对某个概念的视觉识别。SIU 包含两个关键方面:(i) 构建多方面微调数据。我们引入了四个目标,并基于此为需要被遗忘的概念构建微调数据;(ii) 联合训练损失。为了在同步遗忘概念的视觉识别和保持 MLLM 实用性之间取得平衡,我们通过一种新颖的双重掩码 KL 散度损失结合交叉熵损失来微调 MLLM。伴随我们的方法,我们建立了 MMUBench,一个用于 MLLM 中 MU 的新基准,并引入了一系列评估指标。在 MMUBench 上的实验结果表明,SIU 完全超越了现有方法的性能。此外,我们惊讶地发现,SIU 能够规避侵入式成员推理攻击和越狱攻击。据我们所知,我们是首个在 MLLM 中探索 MU 的团队。我们将在不久的将来发布代码和基准。
引用
@article{arxiv.2405.12523,
title = {Single Image Unlearning: Efficient Machine Unlearning in Multimodal Large Language Models},
author = {Jiaqi Li and Qianshan Wei and Chuanyi Zhang and Guilin Qi and Miaozeng Du and Yongrui Chen and Sheng Bi and Fan Liu},
journal= {arXiv preprint arXiv:2405.12523},
year = {2025}
}