中文

大规模推理模型的选择性遗忘

人工智能 2026-04-07 v1

摘要

大规模推理模型(LRM)在生成最终答案之前会生成结构化的思维链(CoT),因此尤其容易通过中间推理步骤泄露知识。然而,训练数据中敏感信息(如版权和私人内容)的记忆已引发伦理和法律关切。为解决这些问题,选择性遗忘(也称为机器不可知)在LRM中日益流行。然而,现有不可知方法主要针对最终答案,遗忘后可能降低整体推理能力。此外,直接对整个CoT进行不可知操作可能损害通用推理能力。LRM不可知的关键挑战在于实现对目标知识的精准遗忘,同时保持一般推理能力的完整性。为填补这一差距,本文提出一种新型LRM不可知框架,通过选择性移除敏感推理组件来实现知识遗忘,同时保留一般推理能力。我们的做法利用多个LLM配合检索增强生成(RAG)分析CoT痕迹,识别遗忘相关片段,并用保持逻辑结构的良性占位符替换它们。我们还引入了一种新的特征替换不可知损失,可同时抑制生成被遗忘内容的概率,同时强化结构上有效的替换。对合成数据和医疗数据进行大量实验验证,我们所提方法具有理想属性。

关键词

引用

@article{arxiv.2604.03571,
  title  = {Selective Forgetting for Large Reasoning Models},
  author = {Tuan Le and Wei Qian and Mengdi Huai},
  journal= {arXiv preprint arXiv:2604.03571},
  year   = {2026}
}