中文

斩首即止冲突:一种解释与缓解语言模型中知识冲突的机制

计算与语言 2024-02-29 v1 人工智能 信息检索

摘要

近期,检索增强和工具增强展示了通过提供外部上下文来扩展语言模型(LMs)内部记忆边界的卓越能力。然而,内部记忆与外部上下文不可避免地会发生冲突,导致 LMs 内部出现知识冲突。本文旨在从信息流的角度解释知识冲突的机制,随后通过在关键点进行精确干预来缓解冲突。我们发现,在后层中存在一些具有相反效应的注意力头,其中记忆头可从内部记忆召回知识,而上下文头可从外部上下文检索知识。此外,我们揭示了 LMs 中知识冲突出现的关键点在于记忆头与上下文头对不一致信息流的整合。受此启发,我们提出了一种名为“通过路径修补剪枝头”(PH3)的新方法,该方法无需更新模型参数,仅通过剪枝冲突的注意力头即可高效缓解知识冲突。PH3 可灵活控制八个 LMs 使用内部记忆(提升 44.0%)或外部上下文(提升 38.5%)。此外,PH3 还能提升 LMs 在开放域问答任务上的性能。我们还进行了大量实验,证明了该方法在跨模型、跨关系和跨格式方面的泛化能力。

关键词

引用

@article{arxiv.2402.18154,
  title  = {Cutting Off the Head Ends the Conflict: A Mechanism for Interpreting and Mitigating Knowledge Conflicts in Language Models},
  author = {Zhuoran Jin and Pengfei Cao and Hongbang Yuan and Yubo Chen and Jiexin Xu and Huaijun Li and Xiaojian Jiang and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2402.18154},
  year   = {2024}
}

备注

21 pages, 42 figures, 4 tables