中文

HubRouter:面向混合序列模型的次二次级路由原语

机器学习 2026-04-27 v1 神经与进化计算

摘要

我们提出 HubRouter,一种可插拔模块,用于替换 O(n^2) 注意力层为 O(nM) hub 中介路由,其中 M << n 为少量学习的 hub token。我们在两种从零构建的架构中演示其应用:一种类似 Jamba 的混合架构和一个 12 层 Transformer;对预训练模型的移植在测试中为负案例。HubRouter 实现 encode-decode-score-council 管道:M 个学习的 hub 跨注意力所有 token,token 对 hub 进行投影以获取路由指纹,评分头选择 top-k token,稀疏委员会仅注意于所选子集。我们在三个场景中验证了 HubRouter:(1)Hub-Jamba 实现了名义上的 4.2% PPL 改进(200.2 vs 209.0,单一次随机种子;可能在随机种子噪声范围内)以及在序列长度为 1024 时的匹配 PyTorch 本机基准中实现最高约 90 倍的训练吞吐量;优化后的基准会将这缩小到约 10-15 倍。(2)用 25% 的 Transformer 注意力层逐步替换给出我们匹配预算扫查中最好的 perplexity(268.0 vs 282.4 纯 Transformer)。(3)Hub-GPT 实现严格因果路由,实现 PPL 211.5 +/- 0.4(3 个随机种子;经修复后),约比 Jamba 的 208.5 +/- 0.7 差约 3 PPL,这是一个可衡量的质量代价,旨在避免 O(n^2) 计算。修复后,块大小 C 的影响不大;修复前的块大小收益是我们发现的双向委员会泄漏的副作用。在一次跨 M=1-32 的 hub 数量扫查(约 105 次运行)中,M=8-14 为可靠收敛亚带(4-5/5 随机种子);M=6 通过正交正则化救回至 5/5,而 M>=20 显示出增加的随机种子敏感性。伴随论文 arXiv:2603.20997(Basu, 2026)定义了路由诊断任务。代码和脚本将公开。

关键词

引用

@article{arxiv.2604.22442,
  title  = {HubRouter: A Pluggable Sub-Quadratic Routing Primitive for Hybrid Sequence Models},
  author = {Abhinaba Basu},
  journal= {arXiv preprint arXiv:2604.22442},
  year   = {2026}
}