中文

DDCL-INCRT:一种具有层次化原型结构的自组织变换器(理论基础)

机器学习 2026-04-03 v1 神经与进化计算 机器学习

摘要

现代变换器家族神经网络需要在训练开始前由实践者决定使用多少注意力头、网络应多深、每个组件应多宽。这些决定是在没有任务知识的情况下进行的,导致构建的架构系统性地比必要的更大:经验研究发现,训练后可在不影响性能的前提下移除相当比例的注意力头和层。本文引入 DDCL-INCRT,一种在训练期间自行确定其结构的架构。结合了两种互补的想法。首先,DDCL(Deep Dual Competitive Learning)用一组学习得到的原型向量表示数据中最有信息量的方向,取代了前馈块。原型在训练目标的驱动下自动扩散,无需显式正则化。其次,INCRT(Incremental Transformer)控制注意力头的数量:从一个开始,仅在现有注意力头未捕获的方向信息超过阈值时添加新的注意力头。主要理论发现是,这两种机制相互强化:每个新的注意力头放大原型间的分离,从而提升触发下一添加的信号。收敛时,网络自组织成层次化的注意力头结构,按表示粒度排序。该层次结构被证明是唯一且最小的,即在给定条件下足以完成任务的最小架构。在整个过程中,建立了稳定性、收敛性和修剪安全性的形式保证。该架构不是一种被设计的东西,而是一种被推导出来的东西。

关键词

引用

@article{arxiv.2604.01880,
  title  = {DDCL-INCRT: A Self-Organising Transformer with Hierarchical Prototype Structure (Theoretical Foundations)},
  author = {Giansalvo Cirrincione},
  journal= {arXiv preprint arXiv:2604.01880},
  year   = {2026}
}

备注

30 pages, 5 figures. Submitted to Neural Networks (Elsevier)