中文

解构 LLM 代理的数据组织以提升训练效率

人工智能 2026-05-29 v1 计算与语言

摘要

大型语言模型(LLM)已在各领域取得突破性进展,但其训练效率高度依赖于有效的数据 curation。虽然数据 selection 已广泛研究,但针对 enhanced training 的 strategic data organization 仍是一个备受忽视的领域,尤其是因为当前 LLM 通常仅进行一次或少数几轮训练。本文系统探索了数据 organization 对 LLM 训练的影响,通过重用最初为数据 efficiency 预计算的 sample-level 分数,从而在最小的额外计算开销下实现目标。我们识别并形式化了四项优化数据 organization 关键指南:Boundary Sharpening、Cyclic Scheduling、Curriculum Continuity 和 Local Diversity。遵循这些指南,我们引入两种新颖的数据排序方法,称为STR和SAW。跨不同模型规模和数据规模的大量实验,涵盖 pre-training 和 SFT 阶段,验证了我们总结的指南的有效性。这些实验还显示,我们提出的数据排序方法在提升 LLM 训练的稳定性和性能方面具有鲁棒性。GitHub 链接:https://github.com/microsoft/data-efficacy/

关键词

引用

@article{arxiv.2605.30334,
  title  = {Demystifying Data Organization for Enhanced LLM Training},
  author = {Yalun Dai and Yangyu Huang and Tongshen Yang and Yonghan Wang and Xin Zhang and Wenshan Wu and Qihao Zhao and Hao Li and Yuanyuan Gao and Kim-Hui Yap and Scarlett Li},
  journal= {arXiv preprint arXiv:2605.30334},
  year   = {2026}
}

备注

ACL 2026 Main Conference