中文

ASRU:面向多模态大语言模型的激活引导与强化遗忘学习

计算与语言 2026-05-18 v1 人工智能

摘要

多模态大语言模型可能在预训练期间记忆敏感的跨模态信息,这使得机器遗忘学习变得至关重要。现有方法通常基于输出偏差来评估遗忘效果,而忽略了遗忘后的生成质量。这很容易导致幻觉或僵化的回应,从而影响遗忘后模型的可用性和安全性。为解决这一问题,我们提出ASRU,一个可控的多模态遗忘框架,将生成质量作为核心评估目标。ASRU首先通过激活重定向诱导初始拒绝行为,然后使用定制的奖励函数优化细粒度的拒绝边界,从而在目标知识遗忘和模型效用之间实现更好的权衡。在Qwen3-VL上的实验表明,ASRU仅使用少量保留的监督数据,就在遗忘效果(平均+24.6%)和生成质量(平均5.8倍)上取得了显著提升,同时有效保持了模型效用。

关键词

引用

@article{arxiv.2605.15687,
  title  = {ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models},
  author = {Jiahui Guang and Yingjie Zhu and Cuiyun Gao and Haiyan Wang and Jing Li and Di Shao and Zhaoquan Gu},
  journal= {arXiv preprint arXiv:2605.15687},
  year   = {2026}
}