中文

NITP:面向大语言模型预训练的下一隐式标记预测

计算与语言 2026-05-26 v1

摘要

标准的下一个标记预测(NTP)仅通过输出逻辑空间中的离散标签对语言模型进行监督。我们认为,这种稀疏的单热监督会导致潜在表示空间受限不足,使隐藏状态漂移到退化且各向同性的配置中,从而限制泛化能力。为此,我们提出了下一隐式标记预测(NITP),通过在表示空间中增添稠密的连续监督来augment离散预测。NITP训练模型预测下一个标记的隐式语义内容,使用来自同一模型的浅层表示作为稳定的自监督目标。我们提供的理论分析表明,NITP通过缓解欠受限的自由度并鼓励紧凑且结构化的表示几何,从而正则化优化景观。经验上,对于参数规模从0.5B到9B的密集模型和混合专家(MoE)模型,NITP在下游任务上 consistently 均实现性能提升,计算开销几乎可忽略。在9B参数的MoE模型上,NITP在MMLU-Pro上实现5.7%的绝对提升,C3提升6.4%,CommonsenseQA提升4.3%,仅需约2%的额外训练FLOPs且无额外推理成本。我们的实现已公开于 https://github.com/aHapBean/NITP。

关键词

引用

@article{arxiv.2605.24956,
  title  = {NITP: Next Implicit Token Prediction for LLM Pre-training},
  author = {Xiangdong Zhang and Debing Zhang and Shaofeng Zhang and Xiaohan Qin and Yu Cheng and Junchi Yan},
  journal= {arXiv preprint arXiv:2605.24956},
  year   = {2026}
}

备注

Accepted at ICML 2026