中文

选择性访问早期表示的 Transformer

机器学习 2026-05-07 v2 计算与语言

摘要

近期的一些 Transformer 架构使较后层能够获取在最前层计算的表示,其动机在于观察到随着残差流通过深度被反复变换,低级特征可能变得更难恢复。这些方法中最廉价的添加了静态值残差:学习到的混合系数,在所有 token 和注意力头间均匀地暴露第一层值投影 V1V_1。更具表达能力的稠密或动态替代方案能恢复更细粒度的访问,但代价是更高的内存开销和更低的吞吐量。V1V_1 的有用性不太可能在所有 token、头和上下文中保持恒定;不同位置可能需要不同程度地访问早期词汇或语义信息。因此,我们将早期表示重用视为检索问题而非连接问题,并引入了 Selective Access Transformer (SATFormer),它保留了第一层值路径,同时通过上下文相关的门控控制访问。在参数量从 130M 到 1.3B 的模型中,SATFormer 在验证损失和零样本准确率上始终优于静态值残差基线和 Transformer 基线。其最强增益出现在检索密集型基准上,相比静态值残差提升了约 1.5 个平均点,同时保持了接近基线 Transformer 的吞吐量和内存使用量。门控分析表明存在稀疏、深度相关、头特定和类别敏感的访问模式,支持了 SATFormer 学习早期表示选择性重用而非均匀残差复制的解释。我们的代码可在 https://github.com/SkyeGunasekaran/SATFormer 获取。

关键词

引用

@article{arxiv.2605.03953,
  title  = {Transformers with Selective Access to Early Representations},
  author = {Skye Gunasekaran and Téa Wright and Rui-Jie Zhu and Jason Eshraghian},
  journal= {arXiv preprint arXiv:2605.03953},
  year   = {2026}
}