面向多模态大语言模型的推理保留式无学习方法
计算与语言
2025-12-23 v1 人工智能
机器学习
摘要
机器无学习旨在在不进行完整再训练的情况下擦除训练模型中的请求数据。对于推理多模态大语言模型(RMLLMs),这一任务具有独特的挑战性:中间的链式思考步骤即使在最终答案被遗忘后,仍可能泄露敏感信息,而过于激进的干预又容易损害一般推理能力。然而,目前尚无基准能够同时评估无学习方法在抑制推理层面泄露方面的效果,以及保持推理能力的水平。为填补这一空白,我们提出了RMLLMU-Bench,首个用于RMLLM无学习的基准测试,它扩展了标准遗忘指标,加入专门的推理泄露和推理保留度量。在RMLLMU-Bench上的系统评估表明,现有针对多模态大语言模型(MLLMs)和大型(语言)推理模型(LRMs)的无学习方法,要么在推理过程中留下 substantial 泄露,要么严重损害推理性能。为解决这些问题,我们提出了R-MUSE(通过子空间引导和自适应驾驶实现推理保留式MLLM无学习),这是一种无训练、基于推理时间的干预框架,通过引导内部表示遗忘答案和推理痕迹,同时显式保留一般推理能力。在RMLLMU-Bench上的实验表明,R-MUSE在有效遗忘与推理保留之间实现了显著更好的平衡。
引用
@article{arxiv.2512.17911,
title = {Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models},
author = {Hongji Li and Junchi yao and Manjiang Yu and Priyanka Singh and Xue Li and Di Wang and Lijie Hu},
journal= {arXiv preprint arXiv:2512.17911},
year = {2025}
}