中文

MQuAKE:通过多跳问题评估语言模型中的知识编辑

计算与语言 2024-09-10 v3

摘要

大型语言模型(LLMs)中存储的信息很快就会过时,而从零开始重新训练通常不可行。这最近催生了一系列通过更新模型权重注入新事实的技术。当前的评估范式极为有限,主要验证对编辑事实的回忆,但更改一个事实应引起模型相关信念的连锁变化。如果我们将英国首相编辑为现为 Rishi Sunak,那么对于“谁与英国首相结婚?”应得到不同的答案。本工作中,我们提出一个基准 MQuAKE(用于知识编辑的多跳问答),由多跳问题组成,用于评估被编辑模型是否能正确回答那些因编辑事实的蕴含后果而答案应改变的问题。我们发现当前知识编辑方法能准确回忆编辑事实,却在所构建的多跳问题上灾难性失败。因此我们提出一种简单的基于记忆的方法 MeLLo,将所有编辑事实外部存储,同时迭代提示语言模型生成与编辑事实一致的答案。尽管 MQuAKE 仍具挑战性,我们展示了 MeLLo 能随 LLMs(如 OpenAI GPT-3.5-turbo)良好扩展,并以大幅优势超越先前的模型编辑器。

关键词

引用

@article{arxiv.2305.14795,
  title  = {MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop Questions},
  author = {Zexuan Zhong and Zhengxuan Wu and Christopher D. Manning and Christopher Potts and Danqi Chen},
  journal= {arXiv preprint arXiv:2305.14795},
  year   = {2024}
}

备注

EMNLP 2023. Our code and datasets are available at https://github.com/princeton-nlp/MQuAKE