中文

光滑阅读:桥接循环 LLM 与自注意力 LLM 在长上下文任务中的差距

计算与语言 2025-07-28 v1 人工智能

摘要

最近,计算复杂度为线性的循环大语言模型 (Recurrent LLMs) 重新成为高效替代方案,然而自注意力 LLM (Self-Attention LLMs) 的计算复杂度为二次方。然而,循环 LLMs 常因其有限的固定大小记忆在长上下文任务中表现不佳。以往研究主要致力于通过架构创新提升循环 LLMs 的记忆容量,但这些方法尚未使循环 LLMs 在长上下文任务上达到 Self-Attention LLMs 的性能。我们认为,这一限制源于一次性处理整个上下文并不利于循环 LLMs。在本文中,我们提出 Smooth Reading 方法,灵感来自人类阅读策略。Smooth Reading 以块状处理上下文并迭代总结上下文信息,从而降低记忆需求并使方法更适用于循环 LLMs。我们的实验结果表明,该方法显著缩小了循环 LLMs 与 Self-Attention LLMs 在长上下文任务中的性能差距,同时保持了循环 LLMs 的效率优势。我们的 Smooth Reading 将 SWA-3B-4k (一种循环 LLMs) 的性能提升至比 Self-Attention LLMs 高出 3.61%,而此前仅低于 5.68%。此外,该方法在 64k 上下文下仍保持高效,训练速度提升 3 倍,推理速度提升 2 倍。据我们所知,这是首个在长上下文任务中使循环 LLMs 达到与 Self-Attention LLMs 相当性能的工作。我们希望本方法将激发此领域的未来研究。为进一步推进进展,我们将公开代码和数据集。

关键词

引用

@article{arxiv.2507.19353,
  title  = {Smooth Reading: Bridging the Gap of Recurrent LLM to Self-Attention LLM on Long-Context Tasks},
  author = {Kai Liu and Zhan Su and Peijie Dong and Fengran Mo and Jianfei Gao and ShaoTing Zhang and Kai Chen},
  journal= {arXiv preprint arXiv:2507.19353},
  year   = {2025}
}