中文

E^2-LLM:大语言模型的高效极限长度扩展

计算与语言 2024-02-23 v3 人工智能

摘要

通常,训练具有长上下文长度的大语言模型(LLMs)计算成本高昂,需要大量的训练时间和 GPU 资源。现有的长上下文扩展方法通常需要额外的训练过程来支持相应的长上下文窗口,这需要长上下文训练数据(例如 32k),并假定高昂的 GPU 训练成本。为解决上述问题,我们提出了一种高效且极限长度扩展的大语言模型方法,称为 E^2-LLM,该方法仅需一次训练过程,并大幅降低了计算成本,同时也无需收集长上下文数据。具体而言,首先,我们的 E^2-LLM 的训练数据仅需短长度(例如 4k),这大大降低了调优成本。其次,在短训练上下文窗口上的训练过程仅执行一次,我们便能在推理时支持不同的评估上下文窗口。第三,在 E^2-LLM 中,基于旋转位置嵌入(RoPE),我们对训练中不同样本的尺度和位置索引参数引入了两种不同的增强方法。其目的是使模型在推理时直接插值任意上下文长度时,对不同相对差异更具鲁棒性。在多个基准数据集上的综合实验结果证明了我们的 E^2-LLM 在具有挑战性的长上下文任务上的有效性。

关键词

引用

@article{arxiv.2401.06951,
  title  = {E^2-LLM: Efficient and Extreme Length Extension of Large Language Models},
  author = {Jiaheng Liu and Zhiqi Bai and Yuanxing Zhang and Chenchen Zhang and Yu Zhang and Ge Zhang and Jiakai Wang and Haoran Que and Yukang Chen and Wenbo Su and Tiezheng Ge and Jie Fu and Wenhu Chen and Bo Zheng},
  journal= {arXiv preprint arXiv:2401.06951},
  year   = {2024}
}