追踪大型语言模型中的关系知识召回
计算与语言
2026-04-24 v2
摘要
我们研究大型语言模型在文本生成过程中如何召回关系知识,重点在于通过线性探针识别适合关系分类的潜在表示。先前的工作展示了注意力头和MLP如何交互以解析主语、谓语和宾语,但目前尚不清楚哪些表示支持忠实的线性关系分类,以及为什么某些关系类型比其他类型更容易被线性捕获。我们系统地评估了源自注意力头和MLP贡献的不同潜在表示,表明每个注意力头对残差流的贡献是线性关系分类中相对较强的特征。对训练后的探针进行的特征归因分析,以及不同关系类型的特征,揭示了探针准确率与关系特异性、实体连通性以及探针所依赖的信号在注意力头间的分布程度之间存在明显的相关性。最后,我们展示了如何使用探针预测的token级特征归因来更详细地揭示探针行为。
引用
@article{arxiv.2604.19934,
title = {Tracing Relational Knowledge Recall in Large Language Models},
author = {Nicholas Popovič and Michael Färber},
journal= {arXiv preprint arXiv:2604.19934},
year = {2026}
}
备注
ACL 2026 (findings)