面向选择性多模态大语言模型忘却的良性记忆
人工智能
2025-11-26 v1
摘要
多模态大语言模型(MLLM)取得了显著的能力,但可能不可避免地记忆隐私敏感信息。虽然现有忘却方法能够移除此类知识,但往往无法实现良性忘却,因为它们常常会损害模型的整体图像理解性能。为此,我们提出Sculpted Memory Forgetting Adapter(SMFA),以局部记忆区域进行精准忘却,同时保持整体能力。SMFA首先微调模型以将敏感响应替换为拒绝,从而获得记忆忘却适配器,然后应用基于锚点的遮蔽机制,以防止干扰无关知识和理解能力。为系统评估选择性MLLM忘却,我们引入S-MLLMUn基准,这是首个旨在联合评估敏感知识删除和一般视觉理解保留的基准测试。大量实验表明,与先前方法不同,SMFA实现了精准可控的忘却,同时保持模型的基础图像理解能力。
引用
@article{arxiv.2511.20196,
title = {Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning},
author = {Zhen Zeng and Leijiang Gu and Zhangling Duan and Feng Li and Zenglin Shi and Cees G. M. Snoek and Meng Wang},
journal= {arXiv preprint arXiv:2511.20196},
year = {2025}
}