分析语言模型在知识冲突下的残差流
计算与语言
2025-02-11 v2
摘要
大型语言模型(LLM)能够在其参数中存储大量事实知识。然而,这些参数化知识可能与上下文提供的信息发生冲突。这种冲突可能导致模型出现不可取的行为,例如依赖过时或不正确的信息。在本工作中,我们研究语言模型是否能够识别知识冲突,以及通过分析语言模型的残差流来了解模型将依赖哪些知识。通过探测任务,我们发现语言模型能够在残差流中内部注册知识冲突的信号,这些信号可以通过探测中间模型激活来准确检测。这使我们能够在生成答案而不修改输入或模型参数的情况下检测残差流中的冲突。此外,我们发现当模型依赖上下文知识来解决冲突时,残差流呈现出显著不同的模式。这种模式可用于估计冲突发生时的模型行为,并在生成答案之前防止意外答案。我们的分析为理解语言模型如何内部管理知识冲突提供了见解,并为开发控制知识选择过程的方法奠定了基础。
引用
@article{arxiv.2410.16090,
title = {Analysing the Residual Stream of Language Models Under Knowledge Conflicts},
author = {Yu Zhao and Xiaotang Du and Giwon Hong and Aryo Pradipta Gema and Alessio Devoto and Hongru Wang and Xuanli He and Kam-Fai Wong and Pasquale Minervini},
journal= {arXiv preprint arXiv:2410.16090},
year = {2025}
}
备注
Foundation Model Interventions Workshop @ NeurIPS 2024