中文

面向LLM忘卸数据Pareto改进的随机偶极搜索

机器学习 2026-04-21 v1 人工智能

摘要

大型语言模型(LLM)有时会记忆不需要的知识,这在部署后必须被删除。先前的机器忘卸工作主要集中在调整参数以强制忘卸同时保持保留的优化方法上。然而,这些方法假设忘卸集和保留集 readily 可用,这在实际中很少成立。忘卸通常是在推理时触发的,使相关数据的检索成为核心挑战。我们提出了LLM忘卸的数据Pareto改进的概念,将检索形式化为如何扩展忘卸与保留之间可实现的trade-off前沿。为实现这一原则,我们提出了Randomized Antipodal Search on Linearized Influence Kernel(RASLIK),一种检索算法,将排列-投影哈希与随机偶极搜索结合起来。RASLIK减少了选择方差,实现亚线性复杂度,并在质量和效率上实现双倍收益。在多个模型、数据集和忘卸算法上,RASLIK consistently优于确定性基准,即使是oracle抽样,也建立了随机搜索作为数据中心忘卸的一个原则且可扩展的解决方案。

关键词

引用

@article{arxiv.2604.16591,
  title  = {Randomized Antipodal Search Done Right for Data Pareto Improvement of LLM Unlearning},
  author = {Ziwen Liu and Huawei Lin and Yide Ran and Denghui Zhang and Jianwen Xie and Chuan Li and Weijie Zhao and Zhaozhuo Xu},
  journal= {arXiv preprint arXiv:2604.16591},
  year   = {2026}
}

备注

Preprint