数据生成过程中的层次性潜在结构统一解释Transformer模型中的各种机制现象
计算与语言
2026-03-10 v1 机器学习
摘要
当代研究揭示了Transformer-based语言模型中许多令人困惑的现象。建立对这些现象的稳健、统一的理解需要在模型训练范围内对其进行分解。尽管预训练语料库的不可穷透规模限制了从底部进行此类调查,但简化的数据生成过程假设限制了其表达能力,无法解释复杂模式。在本文中,我们使用概率上下文无关文法(PCFG)生成合成语料库,这些语料库是忠实且计算高效的 web规模文本语料库的代理。我们探讨了在设计数据生成过程下的三种机制现象:归纳头、函数向量以及Hydra效应,以及这些现象在真实世界语言模型检查点中的出现情况。我们的发现表明,数据生成过程中的层次结构是解释这些现象产生原因的关键因素。我们提供了层次结构在模型训练动力学中发挥作用的理论依据。总而言之,本工作是首个为 seemingly unrelated的机制现象在LLM中提供统一解释的研究,同时提供了高效的合成工具,适用于未来的解释性研究。
引用
@article{arxiv.2603.06592,
title = {Hierarchical Latent Structures in Data Generation Process Unify Mechanistic Phenomena across Scale},
author = {Jonas Rohweder and Subhabrata Dutta and Iryna Gurevych},
journal= {arXiv preprint arXiv:2603.06592},
year = {2026}
}