揭示大语言模型知识编辑的隐患
计算与语言
2024-05-14 v5 人工智能
计算机视觉与模式识别
数据库
机器学习
摘要
随着微调大语言模型(LLMs)的成本持续上升,近期的研究工作转向开发方法来编辑 LLMs 中隐含的知识。然而,仍有一片阴云笼罩头顶——知识编辑会引发蝴蝶效应吗?因为目前仍不清楚知识编辑是否可能引入带来潜在风险的副作用。本文率先探究了 LLMs 知识编辑相关的潜在隐患。为此,我们引入了全新的基准数据集并提出了创新的评估指标。我们的结果凸显了两个关键问题:(1)知识冲突:编辑在逻辑上相互冲突的事实组会放大 LLMs 固有的不一致性——这是以往方法所忽视的一个方面。(2)知识扭曲:以编辑事实知识为目的而改变参数,会不可逆转地扭曲 LLMs 的固有知识结构。实验结果生动地表明,知识编辑可能无意间给 LLMs 投下意外后果的阴影,这值得未来工作予以关注和努力。代码与数据见 https://github.com/zjunlp/PitfallsKnowledgeEditing。
引用
@article{arxiv.2310.02129,
title = {Unveiling the Pitfalls of Knowledge Editing for Large Language Models},
author = {Zhoubo Li and Ningyu Zhang and Yunzhi Yao and Mengru Wang and Xi Chen and Huajun Chen},
journal= {arXiv preprint arXiv:2310.02129},
year = {2024}
}
备注
ICLR 2024