无需重训练的大型语言模型样本训练顺序效应估计
机器学习
2025-05-29 v1 人工智能
摘要
训练样本顺序在大型语言模型 (LLM) 中起着至关重要的作用,显著影响其外部性能与内部学习动态。研究此效应的传统方法通常需要以各种样本顺序重新训练模型,这对于 LLM 在计算上是不可行的。在本工作中,我们通过设计一种免重训练框架改进了传统方法。通过用一阶和二阶 Taylor 展开近似 Adam 优化器更新,并利用随机投影方法存储中间检查点,我们的框架能够高效估计任意训练样本顺序下的模型参数。接下来,我们将该框架应用于两个下游研究问题:(1) LLM 的训练课程设计——我们基于免重训练框架提出了一种新颖的课程学习策略,通过估计的模型性能来增强课程提议,从而实现更明智的样本调度。(2) LLM 的记忆与泛化效应分析——我们使用免重训练框架估计训练样本的位置如何影响 LLM 的记忆与泛化能力。我们进行了大量实验以验证免重训练框架在复现真实模型性能方面的有效性,并进一步展示了其在优化 LLM 训练课程和分析 LLM 记忆与泛化效应方面的潜力。
引用
@article{arxiv.2505.22042,
title = {Estimating the Effects of Sample Training Orders for Large Language Models without Retraining},
author = {Hao Yang and Haoxuan Li and Mengyue Yang and Xu Chen and Mingming Gong},
journal= {arXiv preprint arXiv:2505.22042},
year = {2025}
}