中文

关于大型语言模型持续忘却

机器学习 2025-03-04 v2 密码学与安全

摘要

尽管大型语言模型在 various 领域和任务中展现出惊人的性能,但其安全问题日益严重。机器忘却作为一种代表性的模型安全和安全措施,通过移除不良数据对目标模型的影响来实现。然而,这些方法在现实场景中不足够考虑忘却请求是持续不断出现的,尤其是在大型语言模型的背景下,可能导致累积的模型实用性损失最终变得不可接受。此外,现有的大型语言模型忘却方法往往忽略了由于隐私 concerns 和版权保护而导致的先前数据访问限制。没有先前的数据,忘却期间的实用性保存就更加困难。为克服这些挑战,我们提出了 OOO 框架,包括用于持续忘却请求数据的正交低秩适配器 (Orthogonal low-rank adapter) 以及用于衡量输入与忘却数据相似性的 Out-Of-Distribution (OOD) 检测器。正交 LoRA 实现了持续忘却请求之间的参数解耦。OOD 检测器通过 novel 对比熵损失进行训练,并利用一种 glocal-aware 评分机制。推理期间,OOO 框架可以根据 OOD 检测器预测的输入与忘却知识之间的相似性,决定是否以及如何加载忘却 LoRA。值得注意的是,OOO 的有效性不依赖于任何保留数据。我们在三个任务和七个数据集上对 OOO 和最先进的大型语言模型忘却方法进行了广泛实验。结果表明,OOO 在各项指标上始终实现了最佳的忘却效果和实用性保存,尤其是在面对持续忘却请求时表现更为出色。源代码可在 https://github.com/GCYZSL/O3-LLM-UNLEARNING 查看。

关键词

引用

@article{arxiv.2407.10223,
  title  = {On Large Language Model Continual Unlearning},
  author = {Chongyang Gao and Lixu Wang and Kaize Ding and Chenkai Weng and Xiao Wang and Qi Zhu},
  journal= {arXiv preprint arXiv:2407.10223},
  year   = {2025}
}

备注

This paper has been accepted by ICLR 2025. The first two authors contribute equally and they are ordered alphabetically