中文

WISE:重新思考大型语言模型持续模型编辑中知识记忆的布局

计算与语言 2024-12-20 v3 人工智能 计算机视觉与模式识别 信息检索 机器学习

摘要

大型语言模型(LLMs)需要进行知识更新以满足不断增长的世界事实,并纠正幻觉式的响应,从而促进持续模型编辑的方法。在此背景下,更新后的知识存储于记忆中的问题是模型编辑的根本性问题。本文发现,无论是编辑长期记忆(直接修改模型参数),还是编辑工作记忆(通过检索实现的神经网络激活/表示的非参数知识),在持续编辑设置下都会导致难以协调的三角形问题——可靠性、泛化性和局部性不能同时实现。对于长期记忆,直接编辑参数会与与之无关的预训练知识或先前的编辑产生冲突(导致可靠性和局部性差)。对于工作记忆,基于检索的激活几乎无法让模型理解编辑并实现泛化(导致泛化性差)。因此,我们提出了 WISE 来填补记忆之间的鸿沟。在 WISE 中,我们设计了双参数记忆方案,包括用于预训练知识的主记忆和用于编辑后知识的副记忆。我们仅编辑副记忆中的知识,并训练一个路由器,在给定查询时决定走哪条记忆路径。对于持续编辑,我们构想了知识分片机制,其中不同的编辑集合驻留于参数的不同子空间中,然后合并到共享记忆中而不会产生冲突。大量实验表明,WISE 能超过以往的模型编辑方法,在持续模型编辑中克服了难以协调的三角形问题,适用于问答、幻觉和越域设置下的持续模型编辑,涵盖当今流行的 LLM 架构,如 GPT、LLaMA 和 Mistral。代码已公开于 https://github.com/zjunlp/EasyEdit。

关键词

引用

@article{arxiv.2405.14768,
  title  = {WISE: Rethinking the Knowledge Memory for Lifelong Model Editing of Large Language Models},
  author = {Peng Wang and Zexi Li and Ningyu Zhang and Ziwen Xu and Yunzhi Yao and Yong Jiang and Pengjun Xie and Fei Huang and Huajun Chen},
  journal= {arXiv preprint arXiv:2405.14768},
  year   = {2024}
}

备注

NeurIPS 2024