中文

打破阶段壁垒:一种用于大型语言模型长上下文扩展的新型单阶段方法

计算与语言 2024-12-11 v1

摘要

最近,大型语言模型(LLMs)彻底改变了自然语言处理(NLP)。预训练的LLMs由于训练上下文大小有限,难以处理长token序列,限制了其在各种下游任务上的性能。当前面向长上下文建模的解决方案通常采用多阶段持续预训练,通过多个持续预训练阶段逐步增加有效上下文长度。然而,这些方法需要大量的人工调优和人工专业知识。在本文中,我们提出了一种新型的单阶段持续预训练方法——头自适应旋转位置编码(HARPE),用于赋予LLMs长上下文建模能力,同时简化训练过程。我们的HARPE利用不同注意力头之间不同的旋转位置编码(RoPE)基频值,并直接在目标上下文长度上训练LLMs。在4个语言建模基准上的广泛实验,包括最新的RULER基准,表明HARPE在单阶段训练中出色地理解和整合长上下文任务,匹配甚至超越了现有的多阶段方法。我们的结果表明HARPE成功打破了训练具有长上下文建模能力的LLMs的阶段壁垒。

关键词

引用

@article{arxiv.2412.07171,
  title  = {Breaking the Stage Barrier: A Novel Single-Stage Approach to Long Context Extension for Large Language Models},
  author = {Haoran Lian and Junmin Chen and Wei Huang and Yizhe Xiong and Wenping Hu and Guiguang Ding and Hui Chen and Jianwei Niu and Zijia Lin and Fuzheng Zhang and Di Zhang},
  journal= {arXiv preprint arXiv:2412.07171},
  year   = {2024}
}