剖析自回归语言模型中事实关联的回忆机制
计算与语言
2023-10-17 v3
摘要
基于 Transformer 的语言模型(LMs)已知在其参数中捕获事实知识。虽然先前的工作探究了事实关联存储于何处,但关于它们在推理过程中如何被内部检索却知之甚少。我们通过信息流的视角研究这一问题。给定主体-关系查询,我们研究模型如何聚合关于主体和关系的信息以预测正确属性。通过对注意力边进行干预,我们首先确定了信息传播至预测的两个关键点:一个来自关系位置,随后另一个来自主体位置。接下来,通过分析这些位置的信息,我们揭示了一个三步内部属性提取机制。首先,最后一个主体位置的表示经历由早期 MLP 子层驱动的富集过程,以编码许多与主体相关的属性。其次,来自关系的信息传播至预测。第三,预测表示“查询”富集后的主体以提取属性。或许令人惊讶的是,这种提取通常通过注意力头完成,其参数中常编码主体-属性映射。总体而言,我们的发现引入了对 LMs 中事实关联如何被内部存储和提取的全面视角,促进了未来关于知识定位与编辑的研究。
引用
@article{arxiv.2304.14767,
title = {Dissecting Recall of Factual Associations in Auto-Regressive Language Models},
author = {Mor Geva and Jasmijn Bastings and Katja Filippova and Amir Globerson},
journal= {arXiv preprint arXiv:2304.14767},
year = {2023}
}
备注
Accepted at EMNLP 2023