重新审视大型视觉语言模型的机器遗忘后行为
机器学习
2026-04-21 v2 人工智能
计算机视觉与模式识别
摘要
大型视觉语言模型(LVLMs)能够识别图像中的个体并披露其敏感个人信息,引发了关键的隐私担忧。机器遗忘旨在从模型中移除此类知识。然而,现有方法很少规定模型应输出什么以替代被遗忘的内容,从而导致“遗忘后遗症”:退化、幻觉或过度拒绝的响应。我们认为,特别是对于生成式 LVLMs,考虑遗忘后响应的质量和信息量至关重要,而非仅仅依赖简单的抑制。为此,我们为 LVLMs 引入了一个新的遗忘任务,要求模型提供保护隐私但兼具信息量且具有视觉依据的响应。我们还提出了 PUBG,一种新颖的遗忘方法,明确将遗忘后行为引导至理想的输出分布。实验表明,尽管现有方法能成功防止隐私泄露,但会遭受遗忘后遗症的困扰,而 PUBG 有效缓解了这些问题,在被遗忘目标上生成无隐私泄露且具有视觉依据和信息量的响应。
引用
@article{arxiv.2506.02541,
title = {Rethinking Post-Unlearning Behavior of Large Vision-Language Models},
author = {Minsung Kim and Nakyeong Yang and Kyomin Jung},
journal= {arXiv preprint arXiv:2506.02541},
year = {2026}
}
备注
11 pages