Transformer 中的方向性路由
机器学习
2026-03-17 v1 人工智能
摘要
我们引入了方向性路由 (directional routing) 一种轻量级机制,为每个 transformer 注意力头提供由共享路由器控制的 learned 抑制方向,仅增加 3.9% 的参数开销。我们在单次运行中训练一个 4.33B 参数的模型 alongside 一个相同的 baseline,然后通过 mechanistic 可解释性追踪所得的电路。路由成为模型的主要计算通道。禁用它会使事实记忆在所有 8 个测试提示上降至接近零概率,并将归纳准确率从 93.4% 降至 0.0%。 knocking out individual attention heads 的影响微乎其微:主要迁移头的移除实际上会增加目标概率,归纳头在没有其最强成员的情况下仍保持 98.6% 的准确率。这种协调机制是不可替代的;它协调的组件并非如此。该模型还会自组织地、without explicit pressure,进入两种体系:early 层的 domain-adaptive routing 和 late 层的 fixed syntactic pruning,其中最不变的层是最关键的 (+42.6 PPL 当禁用时)。路由相对于 baseline 减少 31-56% 的 perplexity,尽管下游 multiple-choice 基准测试尚未反映这些收益。
关键词
引用
@article{arxiv.2603.14923,
title = {Directional Routing in Transformers},
author = {Kevin Taylor},
journal= {arXiv preprint arXiv:2603.14923},
year = {2026}
}