中文

通过逐层监督实现变形器可验证模块化

机器学习 2026-03-20 v1 人工智能

摘要

变形器抗手术控制。对一个被识别为关键控制大写功能的注意力头进行消融,几乎不会产生显著的行为变化,因为分布式冗余会补偿损伤。这种水蜜橘效应使得可解释性产生幻觉:我们可能通过相关性识别组件,但无法预测或控制其因果作用。我们演示了架构干预可以暴露隐藏的模块化。我们的 метод结合了双流处理分离标记和上下文表征、逐层监督为每个深度提供独立梯度信号以及门控注意力正则化向离散激活模式的趋势。当采用逐层监督训练时,模型产生的消融效应比采用标准目标训练的结构相同且无监督的控制模型大5到23倍。这使得对特定行为的控制杠杆提高了4倍:放大识别的注意力头会在模型输出中产生平滑、可预测的变化。关键发现在于架构。没有逐层监督时,消融损伤集中在接近零且方差很小(Winograd标准差0.63%)。采用逐层监督后,效应分布更广(标准差6.32%),揭示了哪些预测依赖于哪些电路。较大的方差并非测量噪声,而是未遮蔽模块化的特征。我们通过三个组件验证了该方法:捕获计算动力学而非词汇结构的工程化特征(通过与原始激活聚类几乎为零相关性验证)、提供模块化的正向控制的架构,以及表明不同任务通过不同注意力头路由的因果实验。本研究建立了将可解释性从被动观察转化为主动控制的方法论。

关键词

引用

@article{arxiv.2603.18029,
  title  = {Engineering Verifiable Modularity in Transformers via Per-Layer Supervision},
  author = {J. Clayton Kerce},
  journal= {arXiv preprint arXiv:2603.18029},
  year   = {2026}
}