中文

MLLMEraser:通过激活引导实现多模态大语言模型的测试时无记忆

机器学习 2026-02-03 v3 人工智能

摘要

多模态大语言模型(MLLMs)在视觉语言任务中展现出惊人的能力,但其大规模部署引发了关于记忆私人数据、过时知识以及有害内容的迫切关注。现有 MLLMs 的无记忆方法通常采用梯度上升或偏好优化等训练基于的策略,但这些方法计算昂贵、不可逆转且常常扭曲保留的知识。在本工作中,我们提出了 MLLMEraser,一个基于输入感知的、训练自由的测试时无记忆框架。我们的方法利用激活引导实现动态知识抹除,无需参数更新。具体而言,我们通过对抗扰动的知识召回图像文本对与知识抹除对应项之间的对比,构建出捕捉文本和视觉差异的多模态抹消方向。为防止不必要的干扰,我们进一步设计了输入感知的引导机制,以自适应方式确定何时以及如何应用抹消方向,在保持保留知识实用性的同时,对指定内容强制忘记。在 LLaVA-1.5 和 Qwen-2.5-VL 上的实验表明,MLLMEraser 在所有指标上均优于多模态大语言模型的最新无记忆基线,实现了更强的忘记性能、更低的计算成本以及最小的实用性退化。

关键词

引用

@article{arxiv.2510.04217,
  title  = {MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering},
  author = {Chenlu Ding and Jiancan Wu and Leheng Sheng and Fan Zhang and Yancheng Yuan and Xiang Wang and Xiangnan He},
  journal= {arXiv preprint arXiv:2510.04217},
  year   = {2026}
}