中文

变压器的可观测性取决于架构

机器学习 2026-05-13 v3 人工智能

摘要

自回归变压器会输出置信的错误,而输出置信度监控无法捕捉这些错误。只有在训练过程中留下超出输出本身所暴露信息的决策质量信号时,激活监控器才会捕捉到它们。这种信号是训练模型的一个架构属性,固定于任何监控器之前。控制输出置信度后,平均控制下60.3%的原始激活探针信号被消除。原始探针信号大多是输出置信度,输出侧的读出无法恢复残余部分。剩余的部分取决于架构和训练。在Pythia的受控训练中,两个匹配宽度的配置在信号形成时都形成了该信号。一个在困惑度继续提高时保持该信号,而另一个则在收敛时擦除该信号。能力与可观测性并非本质上存在矛盾。在独立训练的家族中,即使崩溃点移动,仍然存在这种模式。当信号存续时,监控能捕捉到置信度无法捕捉的东西。在下游问答任务中,一个在WikiText上训练的探针器(无需特定任务调优)可捕捉约1/8的置信错误,而输出置信度监控未能捕捉,仅以20%的误报率标记。这些结果确立了信号工程作为训练时间设计轴,紧随损失和能力之后。架构决定可观测性的条件,而训练决定剩余可读的内容。

关键词

引用

@article{arxiv.2604.24801,
  title  = {Architecture Determines Observability of Transformers},
  author = {Thomas Carmichael},
  journal= {arXiv preprint arXiv:2604.24801},
  year   = {2026}
}

备注

31 pages, 8 figures, 14 tables. v3 of arXiv:2604.24801. Code v5.1.0: https://github.com/tmcarmichael/nn-observability/tree/v5.1.0 Changelog: https://github.com/tmcarmichael/nn-observability/blob/v5.1.0/CHANGELOG.md Croissant: https://github.com/tmcarmichael/nn-observability/blob/v5.1.0/croissant.json