中文

基于内容的路由何时生效?混合序列模型中选择性注意力的表示需求

机器学习 2026-04-17 v2

摘要

我们在混合序列模型中识别出一个路由悖论:基于内容的路由——决定哪些token值得进行昂贵的注意力计算——需要成对计算,而这一需求是不可回避的。通过在三个任务、多个规模(200K至14亿参数)以及15种以上路由机制上的20多项受控实验,我们全面绘制了路由图谱。每个实现高路由精度的系统都通过成对token比较达成。每个避免成对计算的机制均失败:循环模型(Mamba-1.4B:29%)、记忆库(12%)、多臂赌博机(0.7-3.6%)、对比预训练(1.6%)及其他12种方法均聚集在1-29%区间。路由需要两个要素:(1)具有双向上下文的逐token表示与(2)成对token比较。双向Mamba(O(n))+成对比较达到99.5%;将完整成对路由器替换为秩1投影可提升至99.7%。向冻结的Pythia-1B添加一个双向层即可恢复99.4%路由精度。六种不同的O(n)预处理机制(双向Mamba、Perceiver诱导点、端到端训练的因果注意力、稀疏注意力、双向注意力、秩1投影)均成功;全局均值池化(1.9%)与傅里叶混合(0.9%)失败。路由信号占据一个约34维的潜在子空间,对余弦相似度不可见。非可学习索引(布隆过滤器:90.9%;BM25:82.7%)绕过了精确/关键词匹配的瓶颈。将O(n)双向Mamba与秩1成对投影相结合,以线性推理成本实现99.7%路由精度。

关键词

引用

@article{arxiv.2603.20997,
  title  = {When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models},
  author = {Abhinaba Basu},
  journal= {arXiv preprint arXiv:2603.20997},
  year   = {2026}
}