中文

RePAIR:通过基于提示的模型修复实现交互式机器遗忘

人工智能 2026-04-15 v1 计算与语言

摘要

大型语言模型(LLM)在基于大规模网络语料的预训练过程中天然地吸收了有害知识、错误信息和个人数据,却没有天然的选择性删除机制。虽然机器遗忘提供了原则解决方案,但现有方法依赖供应商主导,要求训练管道、精选保留数据集以及来自模型服务提供商(MSP)的直接干预,从而排除了最终用户控制自身数据的情况。我们引入交互式机器遗忘(IMU)范式,用户可通过自然语言在推理时指示 LLM 删除目标知识。为实现 IMU,我们提出 RePAIR 框架,包括(i)用于检测遗忘意图的看门狗模型、(ii)用于生成修复程序的外科手术模型、(iii)可自主更新参数的患者模型。RePAIR 的核心,我们开发了通过伪逆更新将激活引导至拒绝子空间的 Steering Through Activation Manipulation with PseudoInverse(STAMP),这是一种无训练、单样本遗忘方法。其低秩变体将计算复杂度从 O(d^3) 降至 O(r^3 + r^2 * d),实现高效本地遗忘,比基于训练的基线快约 3 倍。广泛实验显示,RePAIR 在抑制有害知识、纠正错误信息和擦除个人数据方面实现接近零遗忘得分(Acc_f = 0.00, F-RL = 0.00),同时保持模型实用性(Acc_r 最高达 84.47,R-RL 最高达 0.88),超越六大最先进基线。这些结果表明 RePAIR 是一个有效且实用的用户驱动模型编辑框架,推动了对已学习知识的透明且本地控制,潜在可扩展至多模态基础模型。

关键词

引用

@article{arxiv.2604.12820,
  title  = {RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair},
  author = {Jagadeesh Rachapudi and Pranav Singh and Ritali Vatsi and Praful Hambarde and Amit Shukla},
  journal= {arXiv preprint arXiv:2604.12820},
  year   = {2026}
}