中文

Transformer 能力获取的几何解剖学

机器学习 2026-04-03 v4 人工智能 计算与语言

摘要

神经网络在训练期间获得能力,但发生在能力获取之前的内部变化尚不清楚。特别是几何变化与行为变化之间的关系,以及任务难度和模型规模对该关系的影响,尚不明了。我们在六个 Transformer 规模(405K--151M 参数)、八个算法任务(144 个任务×\timeslevel×\timesmodel 组合)和三个 Pythia 语言模型(160M--2.8B)中跟踪几何措施和线性探针。在所有设置下,表征首先坍缩到低维状态,然后恢复,只有随后行为性能才会提高。线性探针表明,模型的隐藏状态在模型能够对其进行操作之前就已包含任务相关信息。坍缩底层是任务特定的,坍缩从网络的顶部向下传播,对测试的几何措施中,只有 \rankme 可靠地在困难任务之前预测能力获取。whether 这一前兆可检测到取决于相对于模型容量的任务难度。对于困难任务,有明确的间隙:几何先变,行为随后跟随。对于容易的任务,模型学习得如此迅速,以至于两者同时发生,无法检测到前兆。在 Pythia-2.8B 上,一个对模型而言真正困难的逻辑推理任务显示出约 49K49K 训练步骤的前兆间隙,而容易的基准测试则没有前兆。这表明,当任务相对于模型容量保持困难时,小规模代理模型中观察到的几何模式可在更大规模时持久存在。

关键词

引用

@article{arxiv.2602.15997,
  title  = {The Geometric Anatomy of Capability Acquisition in Transformers},
  author = {Jayadev Billa},
  journal= {arXiv preprint arXiv:2602.15997},
  year   = {2026}
}

备注

19 pages (13 pages main, 6 pages appendix), 13 tables, 8 figures. v4: significant rewrite with additional experiments