混合 DeltaNet-Attention 解码器中更短的缓存证明
机器学习
2026-05-19 v1
摘要
我们研究混合循环-注意力解码器的表达力,这类架构用于近期开源语言模型,如 Qwen3-Next 及其后继模型。这类模型将带门控注意力头与循环带门控 DeltaNet 头相结合。在模型表达力或效率方面是否存在形式优势?我们证明确实存在。我们定义了奇偶条件检索任务,表明在常数精度假设下,Qwen 风格的混合 DeltaNet 和 Gated Attention 解码器可在常数缓存下解决该任务,等价于 链条思考步骤。相比之下,纯 Gated DeltaNet 模型不存在类似解答方案,而纯 Gated Attention 则至少需要多项式缓存。
引用
@article{arxiv.2605.16640,
title = {Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders},
author = {Tomasz Steifer},
journal= {arXiv preprint arXiv:2605.16640},
year = {2026}
}
备注
Under review at a ML conference