中文

面向平衡取消学习的实用核心集选择:UPCORE

机器学习 2025-07-18 v2 人工智能 计算与语言

摘要

用户规定或法律框架常要求从预训练模型(包括大型语言模型 LLM)中删除特定信息。这需要从已训练好的模型中删除或“忘记”一组数据点,通常会使模型在其他数据点上的性能受到损害。因此,必须在删除信息与保留模型其他能力之间取得平衡,若无法平衡则可能导致删除效果不佳或模型不可用。为此,我们提出 UPCORE(Utility-Preserving Coreset Selection),一种无方法论依赖的数据选择框架,用于减轻取消学习过程中的副作用。我们发现模型损伤与模型在待删除集合上的表示方差相关,通过有选择地修剪待删除集合以移除离群点,从而最小化取消学习后的模型退化。在三种标准取消学习方法下,UPCORE 均实现了删除有效性与模型保持之间的优越平衡。为更好地评估这一权衡,我们引入一种新指标,衡量标准指标下的曲线下面积(AUC)。我们的结果表明,UPCORE 在提升标准指标和 AUC 方面均取得改进,得益于核心集与修剪点之间的正向传递,同时减少了待删除集合对外部点的负向传递。

关键词

引用

@article{arxiv.2502.15082,
  title  = {UPCORE: Utility-Preserving Coreset Selection for Balanced Unlearning},
  author = {Vaidehi Patil and Elias Stengel-Eskin and Mohit Bansal},
  journal= {arXiv preprint arXiv:2502.15082},
  year   = {2025}
}

备注

Code: https://github.com/Vaidehi99/UPCORE