中文

RULE:强化忘卸实现忘保留帕累托最优

计算与语言 2025-06-10 v1 机器学习

摘要

大型语言模型(LLM)基于海量未筛选语料训练,导致包含敏感信息、版权受保护内容或非法内容的现象日益受到关注。这推动了 LLM 忘卸(unlearning)研究,即从模型中选择性地删除特定信息,而无需从头重新训练或降低整体效用。然而,现有方法常依赖大规模的忘卸与保留数据集,存在响应不自然、泛化差或效用崩溃等问题。本文提出强化忘卸(Reinforcement UnLearning, RULE),一种高效框架,将忘卸建模为拒绝边界优化问题。RULE 通过少量忘卸数据和合成边界查询训练,采用可验证的奖励函数,以鼓励模型在涉及忘卸的查询上安全拒绝,同时保持对合法输入的有用响应。我们提供了理论与实证证据,表明RULE 在不损害模型效用的前提下实现了精准化忘。实验结果显示,仅使用 12% 的忘卸集和 8% 的合成边界数据,RULE 在忘卸质量上领先现有基线提升最高 17.5%,在自然ness 响应上提升 16.3%,实现忘卸-保留帕累托最优。值得注意的是,RULE还提升了模型输出的自然性,加强了训练效率,并展现出强大的泛化能力,能够对语义上相关但未出现的查询进行拒绝。

关键词

引用

@article{arxiv.2506.07171,
  title  = {RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality},
  author = {Chenlong Zhang and Zhuoran Jin and Hongbang Yuan and Jiaheng Wei and Tong Zhou and Kang Liu and Jun Zhao and Yubo Chen},
  journal= {arXiv preprint arXiv:2506.07171},
  year   = {2025}
}

备注

Paper under review