通过双向语言模型编辑化解逆转诅咒
计算与语言
2024-10-15 v2
摘要
近期研究表明,大语言模型(LLMs)在其参数中存储了大量事实知识。但现有 LLM 易因错误或过时知识而产生非预期文本的幻觉。由于重新训练 LLM 资源消耗巨大,模型编辑的概念日益受到关注。尽管出现了基准与方法和单向编辑及评估,却未能探究逆转诅咒。直观而言,若模型内“法国首都是”被编辑为反事实的“伦敦”,则它应能自然推理并回忆反向事实,即“伦敦是……的首都”后接“法国”而非“英国”。本文研究双向语言模型编辑,旨在提供严格的模型编辑评估,以考察被编辑 LLM 能否双向回忆编辑知识。引入一种可逆性新评估指标,并构建名为双向知识编辑评估(BAKE)的基准,用于评估被编辑模型在编辑反向回忆知识的可逆性。我们惊讶地观察到,尽管当前编辑方法与 LLM 能在编辑方向上有效回忆编辑事实,但在反向评估中存在严重缺陷。为缓解逆转诅咒,提出一种名为双向可逆关系建模(BIRD)的方法。设计了一组将主体与客体间双向关系纳入更新模型权重的编辑目标。实验表明,BIRD 通过问答与判断任务提升了四种不同规模代表性 LLM 的性能。
引用
@article{arxiv.2310.10322,
title = {Untying the Reversal Curse via Bidirectional Language Model Editing},
author = {Jun-Yu Ma and Jia-Chen Gu and Zhen-Hua Ling and Quan Liu and Cong Liu},
journal= {arXiv preprint arXiv:2310.10322},
year = {2024}
}