中文

从锚点到监督:基于记忆图的大语言模型无知识学习框架

计算与语言 2026-04-16 v1 人工智能

摘要

大语言模型 (LLM) 可能记忆敏感或受版权保护的内容, 这引发了显著的隐私和法律顾虑. 虽然机器无知识学习已作为潜在解决方案, 但主流方法依赖于用户提供的忘却集, 使得无知识请求难以审计, 并暴露系统于二次泄露和恶意滥用. 我们提出 MAGE, 一个 Memory-grAph Guided Erasure 框架, 实现用户最小化、无语料库的无知识学习. 仅凭轻量级用户锚点即可标识目标实体, MAGE 探测目标 LLM 以恢复与目标相关的记忆, 将其组织为加权的本地记忆图, 并合成受限的监督以进行无知识学习. MAGE 是模型无关的, 可插入标准无知识方法, 且无需访问原始训练语料. 在两个基准测试 TOFU 和 RWKU 上的实验表明, MAGE 的自生成监督在保持整体实用性的同时, 实现了相当于使用外部参考生成的监督相当的有效无知识学习性能. 这些结果支持一种由最小锚点而非用户提供忘却语料驱动的实用且可审计的无知识工作流程.

关键词

引用

@article{arxiv.2604.13777,
  title  = {From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models},
  author = {Wenxuan Li and Zhenfei Zhang and Mi Zhang and Geng Hong and Mi Wen and Xiaoyu You and Min Yang},
  journal= {arXiv preprint arXiv:2604.13777},
  year   = {2026}
}

备注

15 pages, appendix included