评估语言模型中知识编辑的涟漪效应
计算与语言
2023-12-21 v2
摘要
现代语言模型捕获了大量事实知识。然而,某些事实可能被错误诱导或随时间过时,导致生成事实不正确的内容。这催生了多种编辑方法,用于更新模型编码的事实。对这些方法的评估主要聚焦于测试单个事实是否被成功注入,以及其他主体的相似预测是否未改变。本文认为此类评估存在局限,因为注入一个事实(例如“Jack Depp 是 Johnny Depp 的儿子”)会以模型需要更新的附加事实形式引入“涟漪效应”(例如“Jack Depp 是 Lily-Rose Depp 的兄弟姐妹”)。为解决该问题,我们提出一组考虑编辑对相关事实影响的新评估标准。利用这些标准,我们构建了 RippleEdits,一个包含 5K 事实编辑、涵盖多种涟漪效应类型的诊断基准。我们在 RippleEdits 上评估了主流编辑方法,表明当前方法未能在模型知识中引入一致的变化。此外,我们发现一个简单的上下文编辑基线在我们的基准上取得了最佳分数,这暗示了模型编辑的一个有前景的研究方向。
引用
@article{arxiv.2307.12976,
title = {Evaluating the Ripple Effects of Knowledge Editing in Language Models},
author = {Roi Cohen and Eden Biran and Ori Yoran and Amir Globerson and Mor Geva},
journal= {arXiv preprint arXiv:2307.12976},
year = {2023}
}
备注
Accepted for publication in Transactions of the Association for Computational Linguistics (TACL), 2024. Author's final version