基于群相对策略优化的强化学习无记忆
机器学习
2026-03-23 v3
摘要
在预训练期间,大语言模型不慎记忆了敏感或受版权保护的数据,这在遵循GDPR和欧盟AI法案等法律框架方面提出了重大的合规挑战。满足这些要求需要能够在不从头重新训练的情况下从已部署模型中删除信息的技术。现有的无记忆方法试图满足这一需求,但往往泄露它们旨在擦除的数据,牺牲流畅性和鲁棒性,或依赖于高成本的外部奖励模型。我们引入PURGE(Policy Unlearning through Relative Group Erasure),一种基于群相对策略优化框架的新方法,将无记忆形式化为一个可验证的问题。PURGE使用内在奖励信号对提及禁止概念的任何内容进行惩罚,从而实现安全且一致的无记忆。我们的方法在目标token使用量上比最先进的方法低最高可达46倍,同时在流畅性上提高5.48%,在对抗鲁棒性上提高12.02%。在Real World Knowledge Unlearning(RWKU)基准上,PURGE实现了11%的无记忆效果,同时保持了98%的原始效用。PURGE表明,将LLM无记忆形式化为可验证任务能够实现更可靠、更高效、更可扩展的遗忘,为结合理论保证、改进安全性和实际部署效率的无记忆研究指明了前景的新方向。
引用
@article{arxiv.2601.20568,
title = {Reinforcement Unlearning via Group Relative Policy Optimization},
author = {Efstratios Zaradoukas and Bardh Prenkaj and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2601.20568},
year = {2026}
}
备注
Accepted to ICLR 2026