TOFU:大语言模型的虚构遗忘任务
机器学习
2024-01-12 v1 计算与语言
摘要
在来自网络的海量数据语料库上训练的大语言模型可能会记忆并复现敏感或私有数据,引发了法律和伦理方面的担忧。遗忘,即调整模型以忘记其训练数据中存在的信息,为我们提供了一种在训练后保护私有数据的方法。尽管存在几种此类遗忘方法,但尚不清楚它们在多大程度上能使模型等同于那些从一开始就从未学习过待遗忘数据的模型。为应对这一挑战,我们提出了 TOFU,一个虚构遗忘任务,作为一个基准,旨在帮助加深我们对遗忘的理解。我们提供了一个包含 200 个多样化合成作者档案的数据集,每个档案包含 20 个问答对,以及这些档案的一个子集,称为遗忘集,作为遗忘的目标。我们编制了一套协同工作的指标,以提供遗忘效果的整体图景。最后,我们提供了一组来自现有遗忘算法的基线结果。重要的是,我们所考虑的所有基线均未显示出有效的遗忘,这激励我们继续努力开发遗忘方法,以有效地调整模型,使其真正表现得如同从未在遗忘数据上训练过一样。
引用
@article{arxiv.2401.06121,
title = {TOFU: A Task of Fictitious Unlearning for LLMs},
author = {Pratyush Maini and Zhili Feng and Avi Schwarzschild and Zachary C. Lipton and J. Zico Kolter},
journal= {arXiv preprint arXiv:2401.06121},
year = {2024}
}
备注
https://locuslab.github.io/tofu/