中文

面向高效深度扩展的通用 YOCO

计算与语言 2026-04-02 v1

摘要

测试时扩展的兴起极大提升了大型语言模型(LLM)的推理能力和智能体性能。然而,标准变换器在高效扩展推理计算时仍感困难,因为常规循环策略存在高计算开销,且随模型深度而膨胀的 KV 缓存。我们提出了通用 YOCO(YOCO-U),它将 YOCO 解码器-解码器架构与递归计算相结合,实现单独使用时无法达到的协同效应。基于 YOCO 框架,YOCO-U 实现了一个通用自解码器(Universal Self-Decoder),通过参数共享执行多次迭代,同时将迭代过程限制在浅层高效注意力层中。这种组合方式实现了能力与效率之间的有利的权衡,这既不是 YOCO 也不是递归单独实现的效果。YOCO 架构提供恒定的全局 KV 缓存和线性预填充,而部分递归通过有限的开销增强表示深度。最终,YOCO-U 在保持高效推理的同时提高了标记效用和扩展行为。实验结果表明,YOCO-U 在一般和长上下文基准测试中仍保持高度竞争力,表明高效注意力架构与递归计算的集成是可扩展 LLM 的有前景的方向。

关键词

引用

@article{arxiv.2604.01220,
  title  = {Universal YOCO for Efficient Depth Scaling},
  author = {Yutao Sun and Li Dong and Tianzhu Ye and Shaohan Huang and Jianyong Wang and Furu Wei},
  journal= {arXiv preprint arXiv:2604.01220},
  year   = {2026}
}