稀疏注意力中的路由吸收:为何随机门难以打败
机器学习
2026-03-04 v1 计算与语言
摘要
变压器能否在训练期间学习哪些注意力条目重要呢?原则上可以:注意力分布高度集中,小型门控网络可在事后准确识别重要条目。但实际中几乎不行。当稀疏注意力端到端训练时,模型的Q/K/V投影会共同适应所施加的掩码,吸收路由信号,导致学习到的门几乎不如冻结随机门。我们称之为路由吸收,并在受控3100万参数变压器中提出四个独立证据:(1)可微软门控在门学习或随机时几乎收敛到相同困惑度(48.73±0.60 vs. 49.83±0.04,基于3个随机种子);(2)硬top-k门控在掩码通过处获得零梯度;(3)将 distilled 到共适应 Q/K/V 的门对 oracle 掩码高F1,但在部署时对 mask-agnostic Q/K/V catastrophic 困惑度(601.6 vs. 48.6);(4)训练期间随机掩码随机化未能防止共适应(78.2 ppl 部署稠密 vs. 37.3 baseline)。我们将路由吸收关联到混合专家(MoE)中的相同现象,随机路由与学习路由相当是因为专家共适应任何路由器,但注意力呈更严重形式:共享 Q/K/V 参数 enables cross-layer compensation pathways,而MoE中专家是自包含模块。 implication is end-to-end稀疏注意力方法中,采用 per-query token-level 门控的路由吸收压力与门与模型参数不对称数成正比,而事后方法通过解耦 representation learning 与 sparsification 完全规避了此问题。
引用
@article{arxiv.2603.02227,
title = {Routing Absorption in Sparse Attention: Why Random Gates Are Hard to Beat},
author = {Keston Aquino-Michaels},
journal= {arXiv preprint arXiv:2603.02227},
year = {2026}
}
备注
14 pages, 4 figures