此事已被编辑?检测语言模型中的知识编辑
计算与语言
2025-02-11 v3 人工智能
摘要
知识编辑方法(KEs)可以更新语言模型从预训练中学习的过时或不准确的知识。然而,KEs 可被用于恶意应用,例如插入虚假信息和有害内容。了解生成的输出是基于被编辑的知识还是基于预训练中的原始知识,能够增加用户对生成模型的信任并提供更大的透明度。针对这一需求,我们提出了一种新任务:检测语言模型中的被编辑知识。给定了一个被编辑的模型和一个通过提示从被编辑的模型中检索到的事实,目标是将该知识分类为未被编辑(基于预训练)或被编辑(基于后续编辑)。我们使用四种知识编辑方法、两个大型语言模型和两个数据集来实例化该任务。此外,我们提出使用隐藏状态表示和概率分布作为检测的特征。我们的结果显示,使用这些特征作为输入到简单的 AdaBoost 分类器中可建立一个强大的基线。该分类器仅需要有限的数据量,甚至在跨域设置下仍能保持其性能。最后,我们发现区分被编辑的知识与未被编辑但相关的知识更具挑战性,这凸显了进一步研究的必要性。我们的工作为解决与大型语言模型强大生成能力相关的恶意模型编辑问题奠定了基础。
关键词
引用
@article{arxiv.2405.02765,
title = {Has this Fact been Edited? Detecting Knowledge Edits in Language Models},
author = {Paul Youssef and Zhixue Zhao and Christin Seifert and Jörg Schlötterer},
journal= {arXiv preprint arXiv:2405.02765},
year = {2025}
}
备注
Accepted at NAACL Main 2025