中文

Skrull:通过动态数据调度实现高效的长上下文微调

机器学习 2025-12-16 v2 人工智能

摘要

长上下文监督微调在增强大型语言模型(LLMs)在长上下文任务上的性能方面发挥着至关重要的作用。为了将 LLMs 平稳地适应到长上下文场景,该过程通常需要在包含长序列和短序列的混合数据集上进行训练。然而,这种异构的序列长度分布对现有的训练系统提出了重大挑战,因为它们无法同时对长序列和短序列实现高训练效率,导致 Long-SFT 中的端到端系统性能次优。在本文中,我们提出了一种关于数据调度的新视角,以解决 Long-SFT 中异构数据分布带来的挑战。我们提出了 Skrull,一种专为高效 Long-SFT 设计的动态数据调度器。通过动态数据调度,Skrull 平衡了长序列和短序列的计算需求,提升了整体训练效率。此外,我们将调度过程表述为一个联合优化问题,并深入分析了其中的权衡。基于这些分析,Skrull 采用了一种轻量级的调度算法,在 Long-SFT 中实现近乎零成本的在线调度。最后,我们在最先进的 LLM 分布式训练系统 DeepSpeed 上实现了 Skrull。实验结果表明,在真实世界的 Long-SFT 场景中,Skrull 平均优于 DeepSpeed 3.76 倍(最高达 7.54 倍)。

关键词

引用

@article{arxiv.2505.19609,
  title  = {Skrull: Towards Efficient Long Context Fine-tuning through Dynamic Data Scheduling},
  author = {Hongtao Xu and Wenting Shen and Yuanxin Wei and Ang Wang and Guo Runfan and Tianxing Wang and Yong Li and Mingzhen Li and Weile Jia},
  journal= {arXiv preprint arXiv:2505.19609},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025