识别大语言模型中的知识编辑类型
计算与语言
2025-05-27 v3 人工智能
摘要
知识编辑已成为更新大型语言模型(LLM)知识的高效技术,近年来受到越来越多的关注。然而,缺乏有效措施来防止该技术被恶意滥用,可能导致 LLM 产生有害编辑。这些恶意修改可能导致 LLM 生成有毒内容,误导用户采取不当行动。面对这一风险,我们提出了新任务:K nowledge E diting T ype I dentification(KETI),旨在识别 LLM 中不同类型的编辑,从而在遇到非法编辑时及时向用户发出警报。作为该任务的一部分,我们提出了 KETIBench,包含五类覆盖最流行有毒类型的有害编辑,以及一类良性事实编辑。我们开发了五个经典分类模型和三个基于 BERT 的模型作为开源和闭源 LLM 的基线识别器。我们的实验结果显示,在涉及四个模型和三个知识编辑方法的 92 项试验中,所有八个基线识别器都实现了相当好的识别性能,凸显了识别 LLM 中恶意编辑的可行性。额外分析表明,识别器的性能独立于知识编辑方法的可靠性,并表现出跨域泛化,从而能够识别来自未知来源的编辑。所有数据和代码均 available in https://github.com/xpq-tech/KETI。
引用
@article{arxiv.2409.19663,
title = {Identifying Knowledge Editing Types in Large Language Models},
author = {Xiaopeng Li and Shasha Li and Shangwen Wang and Shezheng Song and Bin Ji and Huijun Liu and Jun Ma and Jie Yu},
journal= {arXiv preprint arXiv:2409.19663},
year = {2025}
}
备注
Accepted by KDD 2025