从大语言模型的视角重新思考数据混合策略
计算与语言
2026-04-10 v1 人工智能
机器学习
摘要
数据混合策略是大型语言模型(LLM)训练的关键因素。经验证明,不恰当的策略会显著降低泛化能力。虽然近期方法改�了经验性能,但仍存在若干根本性问题:域(Domain)的本质是什么,人类与模型对域的感知是否一致,域加权如何影响泛化。我们通过建立梯度动力学与域分布之间的形式化联系,提供了一个理论框架,以阐明域在训练动力学中的作用。基于此分析,我们引入 DoGraph,一个将数据调度形式化为图约束优化问题的重新加权框架。在不同规模的 GPT-2 模型上进行大量实验表明,DoGraph 能持续实现有竞争力的性能。
引用
@article{arxiv.2604.07963,
title = {Rethinking Data Mixing from the Perspective of Large Language Models},
author = {Yuanjian Xu and Tianze Sun and Changwei Xu and XinLong Zhao and Jianing Hao and Ran Chen and Yang Liu and Ruijie Xu and Stephen Chen and Guang Zhang},
journal= {arXiv preprint arXiv:2604.07963},
year = {2026}
}