中文

通过知识消除提升大语言模型编辑中的多跳推理能力

计算与语言 2024-08-23 v1

摘要

大语言模型(LLM)面临内部知识不准确和过时信息的问题。知识编辑已成为缓解此类问题的关键方法。尽管当前的知识编辑技术在单跳推理任务中表现前景似乎不错,但在应用到多跳推理时显示出局限。drawing on cognitive neuroscience and the operational mechanisms of LLMs, 我们假设,对编辑后残余的单跳知识导致编辑后的模型在处理多跳问题时会回归到原始答案,从而削弱其在多跳推理任务中的性能。为验证这一假设,我们进行了一系列实验,这些实验经验性地确认了我们的假设。基于验证后的假设,我们提出一种新颖的知识编辑方法,包含Large language model Editing中的知识消除机制(KELE)。具体而言,我们设计了用于残余知识的消除函数和用于新知识的注入函数。通过联合优化,我们推导出最优的recall向量,该向量随后被用于rank-one编辑框架以更新目标模型层的参数。对GPT-J和GPT-2 XL进行大量实验表明,KELE显著增强了编辑后大语言模型的多跳推理能力。

关键词

引用

@article{arxiv.2408.12456,
  title  = {Enhancing Multi-hop Reasoning through Knowledge Erasure in Large Language Model Editing},
  author = {Mengqi Zhang and Bowen Fang and Qiang Liu and Pengjie Ren and Shu Wu and Zhumin Chen and Liang Wang},
  journal= {arXiv preprint arXiv:2408.12456},
  year   = {2024}
}