驯服语言模型中的知识冲突
计算与语言
2025-06-09 v2 机器学习
摘要
当参数化记忆与上下文知识相矛盾时,语言模型(LM)常会遇到知识冲突。以往工作将此冲突归因于“记忆头”与“上下文头”之间的相互作用,即假设这些注意力头分别排他性地促进记忆或上下文。在本研究中,我们超越了这一基本假设,揭示了一个我们称之为上下文信息与参数化记忆叠加的关键现象,即高影响力的注意力头同时贡献于记忆和上下文。基于这一洞察,我们提出了 Just Run Twice(JuICE),一种测试时注意力干预方法,无需微调即可引导 LM 倾向于参数化信念或上下文知识。JuICE 识别一组可靠的注意力头,并利用双次运行方法来缓解叠加效应。在 11 个数据集和 6 种模型架构上的广泛实验表明,JuICE 创下了新的 SOTA 性能与鲁棒的泛化能力,在不同领域的各类冲突类型下均取得了显著且一致的提升。最后,我们从理论上分析了知识冲突以及注意力头中上下文信息与参数化记忆的叠加,这进一步阐明了 JuICE 在这些场景中的有效性。我们的代码可在 https://github.com/GaotangLi/JUICE 获取。
引用
@article{arxiv.2503.10996,
title = {Taming Knowledge Conflicts in Language Models},
author = {Gaotang Li and Yuzhong Chen and Hanghang Tong},
journal= {arXiv preprint arXiv:2503.10996},
year = {2025}
}
备注
ICML 2025 (Spotlight)