Hybrid Linear Attention Done Right:极长上下文中高效蒸馏与有效架构
计算与语言
2026-01-30 v1 人工智能
机器学习
摘要
混合 Transformer 架构将 softmax 注意力块与循环神经网络(RNN)组合,显示出适合长上下文建模的性能-吞吐量平衡,但其采用和研究受限于大规模从头预训练的高昂成本。一些最近的研究表明,预训练的 softmax 注意力块可以通过参数迁移和知识蒸馏转换为 RNN 注意力块。然而,这些迁移方法需要大量训练数据(超过 100 亿 token),且转化后的混合模型也表现不佳,这正是混合模型在 Transformer 基础模型中具有显著推理加速的场景。在本文中,我们提出 HALO(Hybrid Attention via Layer Optimization),即将 Transformer 模型蒸馯到 RNN 注意力混合模型的管道。随后我们提出 HypeNet,一种通过 novel position encoding 方案(称为 HyPE)以及各种架构修改实现长度泛化优势的混合架构。我们将 Qwen3 系列模型转换为 HypeNet,实现了与原始 Transformer 模型相当的性能,同时在长上下文性能和效率方面表现更优。该转换仅需 23 亿 token,仅为预训练数据的千分之一。
引用
@article{arxiv.2601.22156,
title = {Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts},
author = {Yingfa Chen and Zhen Leng Thai and Zihan Zhou and Zhu Zhang and Xingyu Shen and Shuo Wang and Chaojun Xiao and Xu Han and Zhiyuan Liu},
journal= {arXiv preprint arXiv:2601.22156},
year = {2026}
}
备注
20 pages, 8 figures