MaP:用于可靠评估预训练动力学的统一框架
计算与语言
2026-03-17 v2
摘要
可靠评估是大型语言模型(LLM)取得进展的基础,然而在预训练期间进行的评估过程却因显著不稳定性而掩盖了真实的学习动力学。在本工作中,我们系统诊断了这种不稳定性,将其归因于两个独特来源:来自训练随机性的\textit{参数不稳定性}(Parameter Instability)以及来自噪声测量协议的\textit{评估不稳定性}(Evaluation Instability)。为抵消这两种噪声来源,本文引入了\textbf{MaP}框架,这是一个双管齐下的方法,通过无缝集成checkpoint\underline{M}erging\underline{a}nd\underline{P}ass@k指标来实现。Checkpoint合并通过平均最近的模型权重来平滑参数空间,而Pass@k提供了一种鲁棒的、波动率低的统计模型能力估计。大量实验表明,MaP可显著获得更平滑的性能曲线,减少运行间的方差,并确保模型排名更一致。最终,MaP为观察LLM训练动力学提供了更可靠、更忠实的视角,为LLM研究奠定了关键的实证基础。
引用
@article{arxiv.2510.09295,
title = {MaP: A Unified Framework for Reliable Evaluation of Pre-training Dynamics},
author = {Jiapeng Wang and Changxin Tian and Kunlong Chen and Ziqi Liu and Jiaxin Mao and Wayne Xin Zhao and Zhiqiang Zhang and Jun Zhou},
journal= {arXiv preprint arXiv:2510.09295},
year = {2026}
}