中文

基于模式诱导拒绝规则的 in-context 持续忘却

人工智能 2026-05-27 v1

摘要

机器忘却旨在从训练好的语言模型中移除特定数据的影响。在实际部署中,忘却请求往往顺序到达,这挑战现有基于微调的方法:为每个请求进行微调成本高昂,累积 utility loss,可能导致跨请求干扰。为解决这些问题,我们提出ICCU(In-Context Continual Unlearning),一个 in-context 持续忘却框架,通过从忘却数据集诱导出可读的拒绝规则,并在推理时将其作为 filter 或通过 system prompt 应用,无需修改模型参数。由于规则以 order-independent union 形式累积,ICCU具有可组合性和无跨请求干扰,原始 forget-set 数据可在规则诱导后丢弃。大量实验表明,ICCU有效抑制目标知识,同时保持 utility,跨顺序请求扩展性强,对 paraphrased 和 cross-lingual 查询保持鲁健性。

关键词

引用

@article{arxiv.2605.27138,
  title  = {ICCU: In-Context Continual Unlearning via Pattern-Induced Refusal Rules},
  author = {Ruihao Pan and Suhang Wang},
  journal= {arXiv preprint arXiv:2605.27138},
  year   = {2026}
}