多模态大语言模型无学习的视觉引导关键Token正则化
机器学习
2026-01-30 v1 计算机视觉与模式识别
摘要
在多模态大语言模型(MLLM)中进行无学习可防止模型在查询有关目标图像的信息时泄露私人信息。现有的MLLM无学习方法基本采用开发用于LLM的方法。它们统一对待所有答案Token,忽略了它们在无学习过程中所具有的不同重要性。此外,这些方法仅关注语言模态,忽略了指示答案关键Token的视觉线索。在本文中,在构建MLLM无学习问题后,我们提出了视觉引导的关键Token正则化(ViKeR)。我们利用无关的视觉输入来预测理想的事后无学习Token级分布,并使用这些分布来正则化无学习过程,从而优先处理关键Token。进一步,我们通过信息熵定义关键Token,并讨论ViKeR通过Token级梯度重加权的有效性,这放大了对关键Token的更新。在MLLMU和CLEAR基准测试上的实验表明,我们的方法有效地执行了无学习,同时减轻了遗忘并保持了响应连贯性。
引用
@article{arxiv.2601.22020,
title = {Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning},
author = {Chengyi Cai and Zesheng Ye and Peike Li and Bo Han and Jianzhong Qi and Feng Liu},
journal= {arXiv preprint arXiv:2601.22020},
year = {2026}
}