中文

数据分布作为引导大语言模型优化器向更优泛化的杠杆

机器学习 2026-02-03 v1 人工智能

摘要

修改训练数据分布能否引导优化器寻求具有更好泛化能力的解?在本工作中,我们对一个 in-context 线性回归模型进行理论分析,该模型采用多头线性自注意力机制,并比较两种基于梯度的优化器,即梯度下降(GD)和锐度感知最小化(SAM),后者在泛化性能上表现优异,但即使对中等规模的 LLM 训练也代价高昂。我们首次表明,SAM 诱导更低的简单性偏好(SB)——即优化器在训练早期优先学习更简单特征的倾向——并识别了这种减少正是其更好泛化性能的关键因素。鼓励这一洞察,我们演示,通过对训练数据分布进行修改(例如对训练后期学习的样本进行上采样或增广),同样可降低 SB 并实现更好的泛化。我们的广泛实验表明,该策略在多个 LLM 上(包括 Phi2-2.7B、Llama3.2-1B、Gemma3-1B-PT 和 Qwen3-0.6B-Base)在数学推理任务中实现最高可达 18% 的相对准确率提升。

关键词

引用

@article{arxiv.2602.00576,
  title  = {Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs},
  author = {Tushaar Gangavarapu and Jiping Li and Christopher Vattheuer and Zhangyang Wang and Baharan Mirzasoleiman},
  journal= {arXiv preprint arXiv:2602.00576},
  year   = {2026}
}