中文

基于最优传输的大型语言模型实体级遗忘研究

计算与语言 2025-06-09 v3

摘要

指令遵循型大型语言模型(如ChatGPT)日益流行,但这些模型不慎向用户披露私人敏感信息,凸显了机器遗忘技术的必要性,以从模型中删除特定信息。虽然先前的工作聚焦于在实例级忘记小型随机数据子集,但我们认为现实场景往往需要删除整个用户数据,可能需要更谨慎的处理。本研究探索实体级遗忘,即旨在擦除与目标实体相关的所有知识,同时保留其余模型能力。为此,我们引入Opt-Out,一种基于最优传输的遗忘方法,利用模型初始参数到目标参数之间的Wasserstein距离,以实现更有效和细粒度的遗忘。我们还提出了第一个实体级遗忘数据集(ELUDe),用于评估实体级遗忘。我们的实证结果表明,Opt-Out超越了现有方法,为能够在无需完全重新训练的情况下满足用户数据删除请求,构建安全且可适应的LLM树立了新标准。

关键词

引用

@article{arxiv.2406.12329,
  title  = {Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal Transport},
  author = {Minseok Choi and Daniel Rim and Dohyun Lee and Jaegul Choo},
  journal= {arXiv preprint arXiv:2406.12329},
  year   = {2025}
}

备注

ACL 2025 Main