中文

面向语言模型的高效预训练数据选择:多角色协作机制

计算与语言 2025-06-10 v3

摘要

高效的数据选择对于加速语言模型 (LM) 的预训练至关重要。尽管已提出多种方法来提高数据效率,但目前研究有限地解决了这些方法在实现 LM 预训练最佳数据选择方面的内在冲突。为解决这一问题,我们提出一种多角色协作数据选择机制:每个数据选择方法独立基于其准则对数据进行优先级排序,并利用当前模型状态更新其优先级规则,作为数据选择的独立角色;同时设计一个控制台,在不同阶段调整不同角色的影响,并在 LM 预训练过程中动态整合来自所有角色的信息。我们进行大量实证研究来评估我们的多角色框架。实验结果表明,我们的方法显著提高了数据效率,加快了 LM 预训练的收敛速度,在多个语言模型基准测试中实现平均约 10.5% 的相对性能提升,优于当前最先进的方法。

关键词

引用

@article{arxiv.2410.08102,
  title  = {Efficient Pretraining Data Selection for Language Models via Multi-Actor Collaboration},
  author = {Tianyi Bai and Ling Yang and Zhen Hao Wong and Fupeng Sun and Jiahui Peng and Xinlin Zhuang and Chi Zhang and Lijun Wu and Jiantao Qiu and Wentao Zhang and Binhang Yuan and Conghui He},
  journal= {arXiv preprint arXiv:2410.08102},
  year   = {2025}
}