八种评估LLM鲁棒遗忘的方法
计算与语言
2024-02-27 v1
摘要
机器遗忘对从大语言模型(LLMs)中移除有害能力和记忆文本非常有用,但目前尚无统一的方法来严格评估其效果。本文首先调查了现有遗忘评估技术及其局限性。其次,我们对来自Eldan和Russinovich(2023)的“Who's Harry Potter”(WHP)模型进行全面测试,以评估其在遗忘鲁棒性和竞争性方面的表现。尽管WHP的遗忘在Eldan和Russinovich提出的“熟悉度”指标下表现良好,但我们发现:i) 可可靠地提取更多于基准水平的知识;ii) WHP在Harry Potter问答任务中与原始模型持平;iii) 它在表征潜在知识方面相当于原始模型;iv) 在相关领域存在联合遗忘。总体而言,我们的结果突显了避免采用任意指标进行全面遗忘评估的重要性。
引用
@article{arxiv.2402.16835,
title = {Eight Methods to Evaluate Robust Unlearning in LLMs},
author = {Aengus Lynch and Phillip Guo and Aidan Ewart and Stephen Casper and Dylan Hadfield-Menell},
journal= {arXiv preprint arXiv:2402.16835},
year = {2024}
}