谁是哈利·波特?大语言模型中的近似遗忘
计算与语言
2023-10-05 v2 人工智能
摘要
大语言模型(LLMs)在常含受版权保护内容的海量互联网语料上训练。这给模型开发者、用户以及原作者对出版方带来了法律与伦理挑战。本文提出一种从 LLM 中遗忘部分训练数据而无需从头重训的新技术。我们在从 Llama2-7b 模型(Meta 近期开源的生成式语言模型)中遗忘《哈利·波特》书籍的任务上评估了该技术。该模型预训练耗时超 184K GPU 小时,我们展示约 1 GPU 小时的微调即可有效抹去模型生成或回忆哈利·波特相关内容的能力,而其在常用基准(如 Winogrande、Hellaswag、arc、boolq 与 piqa)上的性能几乎不受影响。我们将微调后的模型公开于 HuggingFace 供社区评估。据我们所知,这是首篇提出生成式语言模型有效遗忘技术的论文。我们的技术由三个主要部分组成:首先,我们使用在目标数据上进一步训练的强化模型,通过比较其 logits 与基线模型,识别与遗忘目标最相关的词元。其次,我们将目标数据中的特异表达替换为通用对应项,并利用模型自身预测为每个词元生成替代标签。这些标签旨在近似未曾在目标数据上训练的模型的下一词元预测。第三,我们在这些替代标签上微调模型,从而在模型被提示其上下文时有效擦除原文本于模型记忆中。
引用
@article{arxiv.2310.02238,
title = {Who's Harry Potter? Approximate Unlearning in LLMs},
author = {Ronen Eldan and Mark Russinovich},
journal= {arXiv preprint arXiv:2310.02238},
year = {2023}
}