长上下文持续预训练的学习动力学揭示
计算与语言
2026-04-06 v1
摘要
现有关于长上下文持续预训练(LCCP)的研究主要集中在小规模模型和有限数据场景(数十亿 token),我们认为将这些小规模设置直接迁移到工业级模型风险不足以适应且可能导致训练提前终止。此外,当前的评估方法高度依赖下游基准(如 Needle-in-a-Haystack),往往难以反映内在收敛状态,可能导致“虚假饱和”。本文首次系统性地使用工业级 Hunyuan-A13B(总参数800亿)追踪其在2000亿 token训练轨迹中的 LCCP 动力学。具体而言,我们提出了分层框架,从行为(监督微调探针)、概率(困惑度)和机制(注意力模式)三个层面分析 LCCP 动力学。我们的发现表明:(1) massive data scaling 的必要性:数十亿 token的训练 regime 对工业级 LLM 的 LCCP(如 Hunyuan-A13B)不够,模型在训练超过1500亿 token后才达到饱和。(2)虚假饱和与内在饱和:传统的 NIAH 分数早期报告“假饱和”,而我们的基于困惑度的分析揭示了持续的内在改进,并与下游性能更强相关。(3)训练稳定性的机制性监控:检索头作为高效低资源的训练监视器,其演化的注意力分数可可靠地跟踪 LCCP 进度,并与 SFT 结果高度相关。本工作为工业级 LLM 的 LCCP 提供了全面的监控框架、评估系统和机制解释。
引用
@article{arxiv.2604.02650,
title = {Revealing the Learning Dynamics of Long-Context Continual Pre-training},
author = {Yupu Liang and Shuang Chen and Guanwei Zhang and Shaolei Wang and Suncong Zheng},
journal= {arXiv preprint arXiv:2604.02650},
year = {2026}
}