通过层次化合成数据生成将指令微调的LLM扩展至百万级上下文
计算与语言
2025-04-18 v1 人工智能
摘要
大型语言模型(LLM)在长上下文推理中面临挑战,这不仅是由于序列长度呈二次方程增长的计算复杂度,还因为缺乏和昂贵的长上下文数据标注。几乎没有开源工作系统性地剖析长上下文数据,也没有可公开获取的指令调优数据集的上下文超过10万个token。为弥合这一差距,我们引入一种新颖的事后合成数据生成策略,旨在高效扩展LLM的上下文窗口,同时保持其通用任务性能。我们的方法可扩展至任意长的上下文长度,无受限于可用真实数据的长度,从而有效地解决了原始长上下文数据稀缺的問題。通过逐步旋转位置嵌入(RoPE)比例缩放训练策略,我们展示了我们的模型在最高可达100万token的上下文长度下,在RULER基准测试和InfiniteBench上表现良好,并在通用语言任务上保持稳健的性能。
引用
@article{arxiv.2504.12637,
title = {Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation},
author = {Linda He and Jue Wang and Maurice Weber and Shang Zhu and Ben Athiwaratkun and Ce Zhang},
journal= {arXiv preprint arXiv:2504.12637},
year = {2025}
}
备注
26 pages, 5 figures