中文

少即是更多:面向 LLM 的几何式无学习,数据披露最小化

计算与语言 2026-05-28 v2

摘要

随着大型语言模型(LLM)在实际系统中日益广泛部署,它们必须支持后续删除特定内容,以满足隐私和治理要求。这激励了选择性无学习,其抑制特定实体或主题的信息,同时保持 LLM 的一般实用性。然而,大多数现有的 LLM 无学习方法需要访问原始训练语料库,依赖输出-level 拒绝调优或宽泛梯度更新,在无学习强度、非目标保持和数据可用性之间存在张力。我们提出了几何式无学习(GU),一种直接作用于模型 prompt 条件隐藏状态的方法,无需访问原始训练语料库。具体而言,GU 从小型安全参考 prompt 集合中提炼出紧凑的、低秩的安全行为子空间,并使用轻量级 anchor-in-context 合成 prompt 来触发隐藏表示的局部、基于投影的 alignment 到该安全子空间。对合成非目标锚点的 teacher-蒸馏正则化进一步减少副作用漂移。 在面向隐私的无学习基准测试(ToFU 和 UnlearnPII)上,GU 在保持非目标性能的同时实现了强大的目标抑制,表明仅靠少量合成数据即可实现有效的无学习。

关键词

引用

@article{arxiv.2605.01735,
  title  = {Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure},
  author = {Chenchen Tan and Xinghao Li and Shujie Cui and Youyang Qu and Cunjian Chen and Longxiang Gao},
  journal= {arXiv preprint arXiv:2605.01735},
  year   = {2026}
}

备注

21 pages, 8 Figures