中文

关于 LLM 机制解释研究的可泛化性理论

人工智能 2025-09-30 v1 计算与语言

摘要

关于大型语言模型 (LLM) 的研究日益关注识别其行为的机制解释,但该领域缺乏明确的原则,以确定何时(以及如何)来自一个模型实例的发现可推广到另一个模型。本文解决了一个根本的认识论挑战:就针对特定模型的机制论断而言,何种依据支持将此发现外推到其他 LLM,并且这种外推可能沿哪些维度成立。我提出了五个潜在的对应轴,沿这些轴机制论断可能具有可泛化性,包括:功能轴(它们是否满足相同的功能准则)、发展轴(它们是否在预训练的相同点开发)、位置轴(它们是否占据相同的绝对或相对位置)、关系轴(它们是否以类似方式与其他模型组件相互作用)以及配置轴(它们是否对应于权重空间的特定区域或结构)。为了实证验证这一框架,我分析了“1 后注意力头”(即注意力前一个 token 的注意力头)在 Pythia 模型(14M、70M、160M、410M)随机种子中的发展轨迹。结果显示,1 后注意力在不同模型之间的发展轨迹具有惊人的一致性,而位置一致性则相对有限。此外,较大模型的随机种子在 1 后注意力的起始时间更早、斜率更陡、峰值更高。我还讨论了对此处所述的论证与提议可能的异议。最后,我指出,机制解释研究的可泛化性进展将体现在将 LLM 的构成性设计属性映射到其涌现行为与机制上。

关键词

引用

@article{arxiv.2509.22831,
  title  = {Toward a Theory of Generalizability in LLM Mechanistic Interpretability Research},
  author = {Sean Trott},
  journal= {arXiv preprint arXiv:2509.22831},
  year   = {2025}
}