中文

跨时代的交叉编码: 跟踪语言表示在LLM预训练中的出现与巩固

计算与语言 2026-05-01 v2 人工智能 机器学习

摘要

大型语言模型(LLM)在预训练期间学习非平凡的抽象,例如检测不规则复数名词主语。然而,由于传统评估方法(如基准测试)未能揭示这些具体概念和能力是如何获取的,因此尚不清楚这些特定语言能力的出现时机和方式。为弥合这一差距并更好地理解模型在概念层面的训练,我们使用稀疏交叉编码器发现并对齐不同检查点之间的特征。通过这种方法,我们跟踪了预训练期间语言特征的演变。我们在具有显著性能和表示转移的开源检查点三元组上训练交叉编码器,并引入一种新指标——相对间接效应(RelIE)——来追踪各个特征对任务性能具有决定性作用的训练阶段。我们表明,交叉编码器能够在预训练期间检测特征的出现、维持和停用。我们的做法具有无特定结构性且可扩展的特性,为更可解释和细粒度的分析预训练期间的表示学习提供了可行的道路。

关键词

引用

@article{arxiv.2509.05291,
  title  = {Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining},
  author = {Deniz Bayazit and Aaron Mueller and Antoine Bosselut},
  journal= {arXiv preprint arXiv:2509.05291},
  year   = {2026}
}

备注

Accepted to ACL 2026