多模态大语言模型中基于关键神经元路径编辑的跨模态机器遗忘
机器学习
2025-11-11 v1 人工智能
摘要
多模态大语言模型(MLLM)通过整合文本和视觉等输入,将基础模型扩展到现实世界应用中。然而,其庞大的知识容量引发了人们对隐私泄露、毒性消除和知识产权侵权的日益担忧。机器遗忘(MU)通过选择性地遗忘目标知识同时保留整体模型效用,提供了一种实用的解决方案。当应用于 MLLM 时,现有的基于神经元编辑的 MU 方法面临两个根本挑战:(1)跨模态的遗忘变得不一致,因为现有的逐点归因方法无法捕捉连接不同模态的结构化逐层信息流;以及(2)当同样支持重要推理路径的敏感神经元被剪枝时,通用知识性能会下降,因为这破坏了模型的泛化能力。为了缓解这些局限性,我们提出了一种用于 MU 的多模态关键神经元路径编辑器(MIP-Editor)。我们的方法引入了特定模态的归因分数,以识别负责编码遗忘集知识的关键神经元路径,并通过表示误导应用关键路径感知的神经元编辑。该策略还能实现跨模态的有效且协调的遗忘,同时保留模型的通用能力。实验结果表明,MIP-Editor 在多模态任务中实现了卓越的遗忘性能,最大遗忘率为 87.75%,通用知识保留率最高提升 54.26%。在文本任务上,MIP-Editor 实现了高达 80.65% 的遗忘,并保留了 77.9% 的通用性能。代码可在 https://github.com/PreckLi/MIP-Editor 获取。
引用
@article{arxiv.2511.06793,
title = {Cross-Modal Unlearning via Influential Neuron Path Editing in Multimodal Large Language Models},
author = {Kunhao Li and Wenhao Li and Di Wu and Lei Yang and Jun Bai and Ju Jia and Jason Xue},
journal= {arXiv preprint arXiv:2511.06793},
year = {2025}
}
备注
Accepted at AAAI 2026 as a Conference Paper (Oral Presentation)