Olmo Hybrid:从理论到实践再回归理论
机器学习
2026-04-20 v3 计算与语言
摘要
近期工作展示了非 Transformer 语言模型的潜力,特别是线性循环神经网络和混合了循环与注意力的混合模型。然而,对于这些新架构的潜在优势是否值得承担将其扩展的风险和努力,目前尚未达成共识。为了解决这个问题,我们从几个方面提供了混合模型优于纯 Transformer 的证据。首先,在理论上,我们证明混合模型不仅仅是继承了 Transformer 和线性 RNN 的表达能力,而是可以表达超越两者的任务,例如代码执行。将这一理论付诸实践,我们训练了 Olmo Hybrid,这是一个拥有 7B 参数的模型,在很大程度上与 Olmo 3 7B 相当,但将其滑动窗口层替换为门控 DeltaNet 层。我们证明,Olmo Hybrid 在标准的预训练和中期训练评估中优于 Olmo 3,展示了混合模型在受控的大规模环境中的优势。我们发现,混合模型的扩展效率显著高于 Transformer,这解释了其更高的性能。然而,目前尚不清楚在特定形式问题上更强的表达能力为何会导致更好的扩展效率或在无关的下游任务上表现更优。为了解释这一明显的差距,我们回归理论,论证了为何增强的表达能力应转化为更好的扩展效率,从而完成了这一循环。总的来说,我们的结果表明,混合了注意力和循环层的混合模型是语言建模范式的一个强大扩展:不仅仅是为了减少推理时的内存,更是作为一种获得更具表达能力、在预训练期间扩展性更好的模型的基本方法。
引用
@article{arxiv.2604.03444,
title = {Olmo Hybrid: From Theory to Practice and Back},
author = {William Merrill and Yanhong Li and Tyler Romero and Anej Svete and Caia Costello and Pradeep Dasigi and Dirk Groeneveld and David Heineman and Bailey Kuehl and Nathan Lambert and Chuan Li and Kyle Lo and Saumya Malik and DJ Matusz and Benjamin Minixhofer and Jacob Morrison and Luca Soldaini and Finbarr Timbers and Pete Walsh and Noah A. Smith and Hannaneh Hajishirzi and Ashish Sabharwal},
journal= {arXiv preprint arXiv:2604.03444},
year = {2026}
}
备注
Corrected author list