中文

INCRT:一种在训练期间确定自身架构的增量Transformer

机器学习 2026-04-14 v1 神经与进化计算

摘要

Transformer架构是通过试错方式设计的:注意力头数、深度和头大小在训练开始前固定,没有数学原理来指导选择。这导致系统性的结构冗余——在训练好的模型中,约有一半到四分之三的注意力头可以被移除而不会产生可测量的损失,因为架构在不考虑任务实际需求的情况下分配容量。本文引入INCRT(增量Transformer),一种在训练期间自主确定其结构的网络。从单个头开始,INCRT在其当前配置不可充分时依次添加一个注意力头,并删除已成为冗余的头。每一次增长决策都由来自任务方向结构的单个、在线可计算的几何量驱动,无需单独的验证阶段或人工调度。两个定理构成了理论基础。第一个(稳态收敛)表明,该系统总是到达一个有限的停止配置,同时最小(无冗余头)且充分(无以超过阈值的未捕获方向能量)。第二个(压缩感知类比)提供了一个几何上界,表明该配置可以包含的头数是任务谱复杂度的函数。SARS-CoV-2变异分类和SST-2情感分析上的实验确认了这两个结果:预测值与观察值在所有基准测试中 Within 12%,最终架构在分布特定任务上匹配或优于BERT-base,同时使用三个到七个数量级更少的参数且无需预训练。

关键词

引用

@article{arxiv.2604.10703,
  title  = {INCRT: An Incremental Transformer That Determines Its Own Architecture},
  author = {Giansalvo Cirrincione},
  journal= {arXiv preprint arXiv:2604.10703},
  year   = {2026}
}

备注

19 pages, 6 figures, 5 theorems. Submitted to Neurocomputing (Elsevier)