中文

ICED:基于可解释概念分解的概念级机器遗忘

计算机视觉与模式识别 2026-05-18 v2 人工智能 机器学习

摘要

视觉语言模型(VLM)中的机器遗忘通常在图像或实例级别进行,这使得在不影响无关语义的情况下精确移除目标知识变得困难。由于单张图像通常包含多个纠缠的概念,包括需要遗忘的目标概念和应当保留的上下文信息,这一问题尤为突出。本文提出了一种针对 VLM 的可解释概念级遗忘框架,该框架利用多模态大语言模型从遗忘集中构建紧凑的特定任务概念词汇表。除了模态对齐外,视觉表示被分解为语义概念的稀疏非负组合,为细粒度的知识操作提供了显式接口。基于此分解,我们的方法将遗忘形式化为概念级优化,在选择性地抑制目标概念的同时,保留实例内的非目标语义和全局跨模态知识。在域内和域外遗忘设置下的广泛实验表明,与现有的 VLM 遗忘方法相比,我们的方法能够实现更全面的目标遗忘,更好地保留同一图像中的非目标知识,并保持具有竞争力的模型效用。

关键词

引用

@article{arxiv.2605.14309,
  title  = {ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition},
  author = {Shen Lin and Jing Lin and Junhao Dong and Piotr Koniusz and Li Xu},
  journal= {arXiv preprint arXiv:2605.14309},
  year   = {2026}
}