中文

层次化平衡包装:面向长上下文 LLM 的高效监督微调方法

机器学习 2025-10-14 v3 人工智能

摘要

训练长上下文大语言模型(LLM)具有挑战性,因为混合长上下文和短上下文数据训练往往导致工作量不均衡。现有方法主要使用数据打包来缓解此问题,但未能考虑注意力计算的不均衡以及浪费的通信开销。本文提出了层次化平衡包装(Hierarchical Balance Packing,HBP),其设计了新的批构建方法和训练配方以解决这些效率问题。具体而言,HBP 构建多级数据打包组,每个组根据不同的打包长度进行优化。它将训练样本分配到其最优组,并为每个组配置最有效的设置,包括顺序并行度和梯度检查点配置。为了有效利用多级数据组,我们设计了专为 HBP 设计的动态训练管道,包括课程学习、自适应顺序并行和稳定损失。我们的广泛实验表明,该方法在多个数据集和开源模型上显著减少训练时间,同时保持出色的性能。对于最大的 DeepSeek-V2(236B)Mixture of Experts 模型,我们的方法将训练速度提高 2.4 倍,同时保持竞争性能。代码将在 https://github.com/ModelTC/HBP 发布。

关键词

引用

@article{arxiv.2503.07680,
  title  = {Hierarchical Balance Packing: Towards Efficient Supervised Fine-tuning for Long-Context LLM},
  author = {Yongqiang Yao and Jingru Tan and Kaihuan Liang and Feizhao Zhang and Jiahao Hu and Shuo Wu and Yazhe Niu and Ruihao Gong and Dahua Lin and Ningyi Xu},
  journal= {arXiv preprint arXiv:2503.07680},
  year   = {2025}
}

备注

Accepted in NeurIPS 2025