事实汇总:大语言模型中事实回忆背后的加性机制
机器学习
2024-02-14 v1 计算与语言
摘要
基于 Transformer 的大语言模型(LLM)如何存储和检索知识?我们聚焦于这一任务的最基本形式——事实回忆,即模型被要求显式地呈现存储在提示中的事实,形式如“事实:罗马斗兽场位于哪个国家”。我们发现,事实回忆背后的机制故事比先前认为的更为复杂。它由几个不同、独立且性质各异的机制组成,这些机制以加性方式组合,在正确属性上产生相长干涉。我们将这种通用现象称为加性基元:模型通过汇总多个独立贡献进行计算。每个机制的贡献单独可能不足,但汇总后会在正确答案上产生相长干涉。此外,我们扩展了直接 logit 归因方法,将注意力头的输出归因于单个源词元。我们利用此技术来剖析我们称之为“混合头”的结构——它们本身是来自不同源词元的两个独立加性更新对。
引用
@article{arxiv.2402.07321,
title = {Summing Up the Facts: Additive Mechanisms Behind Factual Recall in LLMs},
author = {Bilal Chughtai and Alan Cooney and Neel Nanda},
journal= {arXiv preprint arXiv:2402.07321},
year = {2024}
}
备注
NeurIPS 2023 Attributing Model Behaviour at Scale Workshop