机制的竞争:追踪语言模型如何处理事实与反事实
计算与语言
2024-06-10 v2
摘要
可解释性研究旨在弥合实证成功与我们对大语言模型 (LLMs) 内部工作原理的科学理解之间的差距。然而,大多数现有研究侧重于分析单一机制,例如模型如何复制或回忆事实知识。在这项工作中,我们提出了机制竞争的公式化,侧重于多种机制之间的相互作用而非单个机制,并追踪其中一种机制如何在最终预测中占据主导地位。我们利用两种可解释性方法:logit 检查和注意力修改,揭示了 LLMs 内部机制如何以及在哪里竞争。我们的发现显示了各种模型组件中机制及其竞争的痕迹,并揭示了能有效控制某些机制强度的注意力位置。代码:https://github.com/francescortu/comp-mech。数据:https://huggingface.co/datasets/francescortu/comp-mech。
引用
@article{arxiv.2402.11655,
title = {Competition of Mechanisms: Tracing How Language Models Handle Facts and Counterfactuals},
author = {Francesco Ortu and Zhijing Jin and Diego Doimo and Mrinmaya Sachan and Alberto Cazzaniga and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2402.11655},
year = {2024}
}
备注
ACL 2024