解开结结绳:长上下文语言模型预训练的高效数据增强策略
计算与语言
2024-09-10 v1 人工智能
摘要
大型语言模型(LLM)致力于扩大上下文窗口,以便模型能够纳入更多信息。然而,训练模型以处理长上下文存在诸多挑战,包括高质量自然长上下文数据的稀缺、模型在短上下文任务上可能出现性能下降,以及注意力机制导致的训练效率降低问题。本文引入了一种名为 Untie the Knots(\textbf{UtK})的新型数据增强策略,旨在预训练阶段高效地使 LLM 具备长上下文能力,而无需修改现有的数据混合方案。具体而言,我们对文档进行分块、随机排列,并构建复杂且结结绳绷的长文本结构;随后训练 LLM 以解开这些结绳,并识别 seemingly 混乱 token 序列中相关的片段。该方法显著提升了模型性能,使其能够准确地注意到长上下文中的相关信息,训练效率也大幅提升。我们在 7B 和 72B 参数规模的模型上进行了大量实验,训练了 200 亿 token,证明 UtK 在 128K 上下文长度下在 RULER 上的准确率分别达到 75% 和 84.5%,显著优于其他长上下文策略。训练好的模型将开放源码供进一步研究使用。
引用
@article{arxiv.2409.04774,
title = {Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models},
author = {Junfeng Tian and Da Zheng and Yang Cheng and Rui Wang and Colin Zhang and Debing Zhang},
journal= {arXiv preprint arXiv:2409.04774},
year = {2024}
}