中文

超越极限:扩展大语言模型上下文长度的技术综述

计算与语言 2024-05-30 v3 机器学习

摘要

近期,大语言模型 展现出了卓越的能力,包括理解上下文、进行逻辑推理以及生成回复。然而,这是以严格的计算和内存需求为代价的,阻碍了它们有效处理长输入序列的能力。本综述对旨在扩展 LLM 序列长度、从而增强其长上下文理解能力的最新技术和方法进行了全面回顾。具体而言,我们回顾并对广泛的技术进行了分类,包括架构修改,如修改的位置编码和改变的注意力机制,这些技术旨在增强对更长序列的处理能力,同时避免计算需求的成比例增加。本研究探讨的多种方法可应用于 LLM 的不同阶段,即训练、微调和推理。这使得 LLM 能够高效处理扩展序列。最后一节讨论了当前方法的局限性,并提出了未来研究方向的展望,强调了序列长度在 LLM 持续发展中的重要性。

关键词

引用

@article{arxiv.2402.02244,
  title  = {Beyond the Limits: A Survey of Techniques to Extend the Context Length in Large Language Models},
  author = {Xindi Wang and Mahsa Salmani and Parsa Omidi and Xiangyu Ren and Mehdi Rezagholizadeh and Armaghan Eshaghi},
  journal= {arXiv preprint arXiv:2402.02244},
  year   = {2024}
}

备注

Accepted to IJCAI 2024 Survey Track -- camera-ready version