中文

时间序列机械解释:分析大型语言模型中组件与知识的演化

计算与语言 2025-06-05 v1

摘要

理解大型语言模型(LLMs)获取和存储事实知识的方式对于增强其可解释性和可靠性至关重要。本文通过追踪预训练过程中注意力头和前馈网络(FFNs)的作用,分析OLMo-7B模型中事实知识表示的演化。我们将这些组件分为四类角色:通用、实体、关系-答案和事实-答案特定,并检验其稳定性和转换。我们的结果表明,LLMs最初依赖于广泛的通用-purpose组件,随后专化为特定用途。一旦模型可靠地预测答案,一些组件就会被重新定位,暗示了一种自适应的学习过程。值得注意的是,注意力头显示出最高的 turnover。我们还提供了证据表明FFNs在整个训练过程中保持更高的稳定性。此外,我们的探针实验揭示了位置-基关系在训练早期比名称-基关系更快收敛到高精度,凸显任务复杂性如何塑造获取动态。这些见解提供了LLMs知识形成机制的视角。

关键词

引用

@article{arxiv.2506.03434,
  title  = {Time Course MechInterp: Analyzing the Evolution of Components and Knowledge in Large Language Models},
  author = {Ahmad Dawar Hakimi and Ali Modarressi and Philipp Wicke and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2506.03434},
  year   = {2025}
}