最小架构是什么?小型 Transformer 中的早期不可逆承诺跨任务现象
机器学习
2026-04-17 v1 人工智能
计算与语言
摘要
变形器何时会对决策做出承诺,以及有什么阻止它们纠正错误?我们提出“prolepsis”概念:变形器会提前做出任务特定的承诺,特定注意力头维持该承诺,且没有层对其进行纠正。复制 \citeauthor{lindsey2025biology} (\citeyear{lindsey2025biology}) 在开放模型(Gemma~2 2B、Llama~3.2 1B)上的规划-site finding 研究中,我们提出五个问题。(Q1)六种残差流方法下无法观察到规划;CLTs 是必需的。(Q2)规划-site 脉冲以相同几何形状复现。(Q3)特定注意力头将决策路由到输出,填补了归因图中标记为不可见的空白。(Q4)搜索需要 层;承诺需要更多层。(Q5)事实记忆显示相同图案在不同网络深度出现,持续出现的规划头与事实性 Top-10 之间无交叉。Prolepsis 是架构性的:模板是共享的,路由载体不同。所有实验均在单块消费级 GPU(16GB VRAM)上完成。
引用
@article{arxiv.2604.15010,
title = {What Is the Minimum Architecture for Prolepsis? Early Irrevocable Commitment Across Tasks in Small Transformers},
author = {Éric Jacopin},
journal= {arXiv preprint arXiv:2604.15010},
year = {2026}
}
备注
24 pages, 3 figures. Under review at COLM 2026. Independent replication of the rhyme-planning finding from Lindsey et al. (2025) on open-weights models; extended to factual recall