中文

通过层次化合成数据生成将指令微调的LLM扩展至百万级上下文

计算与语言 2025-04-18 v1 人工智能

摘要

大型语言模型(LLM)在长上下文推理中面临挑战,这不仅是由于序列长度呈二次方程增长的计算复杂度,还因为缺乏和昂贵的长上下文数据标注。几乎没有开源工作系统性地剖析长上下文数据,也没有可公开获取的指令调优数据集的上下文超过10万个token。为弥合这一差距,我们引入一种新颖的事后合成数据生成策略,旨在高效扩展LLM的上下文窗口,同时保持其通用任务性能。我们的方法可扩展至任意长的上下文长度,无受限于可用真实数据的长度,从而有效地解决了原始长上下文数据稀缺的問題。通过逐步旋转位置嵌入(RoPE)比例缩放训练策略,我们展示了我们的模型在最高可达100万token的上下文长度下,在RULER基准测试和InfiniteBench上表现良好,并在通用语言任务上保持稳健的性能。

关键词

引用

@article{arxiv.2504.12637,
  title  = {Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation},
  author = {Linda He and Jue Wang and Maurice Weber and Shang Zhu and Ben Athiwaratkun and Ce Zhang},
  journal= {arXiv preprint arXiv:2504.12637},
  year   = {2025}
}

备注

26 pages, 5 figures