长上下文大语言模型如是说
计算与语言
2025-11-12 v2
摘要
长上下文是自然语言处理(NLP)中的一个重要课题,贯穿于NLP架构的发展,并为大语言模型(LLMs)提供了巨大机遇,赋予LLMs类似于人类的终身学习能力。然而,对长上下文的追求伴随着诸多障碍。尽管如此,长上下文仍是LLMs的核心竞争优势。在过去两年中,LLMs的上下文长度实现了突破性扩展,达到数百万个tokens。此外,关于长上下文LLMs的研究已超越长度外推,全面聚焦于架构、基础设施、训练和评估技术。受交响诗《查拉图斯特拉如是说》启发,我们将LLM扩展上下文的旅程与人类试图超越自身必死性的尝试进行类比。在本综述中,我们将阐述LLM在对更长上下文的巨大需求与其同样需要接受上下文最终有限这一事实之间的挣扎。为此,我们从架构、基础设施、训练和评估四个视角给出了长上下文LLMs生命周期的全局图景,展示了长上下文技术的全貌。在本综述末尾,我们将提出长上下文LLMs当前面临的10个未解问题。我们希望本综述能作为长上下文LLMs研究的系统介绍。视频:https://www.bilibili.com/video/BV11h9AYoEYj。Github:https://github.com/OpenMOSS/Thus-Spake-Long-Context-LLM。
关键词
引用
@article{arxiv.2502.17129,
title = {Thus Spake Long-Context Large Language Model},
author = {Xiaoran Liu and Ruixiao Li and Mianqiu Huang and Zhigeng Liu and Yuerong Song and Qipeng Guo and Siyang He and Qiqi Wang and Linlin Li and Qun Liu and Ziwei He and Yaqian Zhou and Xuanjing Huang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2502.17129},
year = {2025}
}
备注
a global picture of the lifecycle of long-context LLMs from four perspectives: architecture, infrastructure, training, and evaluation