Agentic Unlearning:当 LLM Agent 遇见机器不可知
机器学习
2026-03-03 v2 人工智能
摘要
本文引入了‛agentic unlearning‛,旨在从具有闭环交互的智能体的参数和持久记忆中移除指定信息。现有不可知方法仅针对参数,存在两个关键缺口:(i) 参数-记忆回流,检索会重新激活参数残留或记忆artifact重新引入敏感内容;(ii)缺乏涵盖参数与记忆路径的统一策略。我们提出Synchronized Backflow Unlearning (SBU),一个在参数和记忆路径上联合不可知的框架。记忆路径采用依赖闭合为基础的不可知技术,修剪孤立实体同时逻辑地作废共享artifact。参数路径采用随机参考对齐,引导模型输出趋向高熵先验。这些路径通过同步双更新协议集成,形成闭环机制,使记忆不可知与参数抑制相互强化,防止跨路径重新污染。医学问答基准的实验表明,SBU在两条路径上显著降低了目标私有信息的痕迹,同时对保留数据的性能影响有限。
引用
@article{arxiv.2602.17692,
title = {Agentic Unlearning: When LLM Agent Meets Machine Unlearning},
author = {Bin Wang and Fan Wang and Pingping Wang and Jinyu Cong and Yang Yu and Yilong Yin and Zhongyi Han and Benzheng Wei},
journal= {arXiv preprint arXiv:2602.17692},
year = {2026}
}
备注
9 pages, 6 figures, 6 tables