RWKU:大型语言模型中实际世界知识遗忘的基准测试
计算与语言
2024-06-18 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)不可避免地会记住训练语料库中包含敏感信息、版权受保护内容以及有害知识;因此,从模型中擦除这些知识至关重要。机器遗忘是一种通过后处理修改模型来高效移除特定知识的有前景的解决方案。本文提出了用于大型语言模型遗忘的实际世界知识遗忘基准测试(RWKU)。RWKU基于以下三个关键因素进行设计:(1)对于任务设置,我们考虑更为实际且具有挑战性的遗忘设置,即遗忘语料库和保留语料库均不可获取。(2)对于知识来源,我们选取200个真实世界著名人物作为遗忘目标,并表明此类流行知识在各种大型语言模型中广泛存在。(3)对于评估框架,我们设计遗忘集合和保留集合,以评估模型在各种实际应用场景中的能力。关于遗忘集合,我们提供了四种成员推断攻击(MIA)方法和九种对抗性攻击探针,以严格测试遗忘效果。关于保留集合,我们以邻近扰动、通用能力、推理能力、真实性、事实性和流畅性等方面评估模型的保留能力。我们在两个遗忘场景、两种模型和六种基线方法上进行了大量实验,并获得了一些有意义的发现。我们将不定期发布我们的基准测试和代码,地址为 http://rwku-bench.github.io,供未来工作使用。
引用
@article{arxiv.2406.10890,
title = {RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models},
author = {Zhuoran Jin and Pengfei Cao and Chenhao Wang and Zhitao He and Hongbang Yuan and Jiachun Li and Yubo Chen and Kang Liu and Jun Zhao},
journal= {arXiv preprint arXiv:2406.10890},
year = {2024}
}
备注
48 pages, 7 figures, 12 tables