中文

语言模型中多 Token 预测的预训练课程

计算与语言 2025-05-30 v1 人工智能

摘要

多 Token 预测 (MTP) 是近期提出的一种语言模型预训练目标。MTP 不再仅预测下一个 Token (NTP),而是使用多个预测头在每个预测步骤中预测接下来的 kk 个 Token。MTP 在提升下游性能、推理速度和训练效率方面展现出潜力,尤其对于大模型而言。然而,先前的工作表明,小型语言模型 (SLMs) 在 MTP 目标上存在困难。为了解决这一问题,我们提出了一种用于 MTP 训练的课程学习策略,并探索了两种变体:一种正向课程,将预训练目标的复杂性从 NTP 逐步增加到 MTP;以及一种反向课程,执行相反的操作。我们的实验表明,正向课程使 SLMs 能够在预训练期间更好地利用 MTP 目标,提升了下游 NTP 性能和生成输出质量,同时保留了自推测解码的优势。反向课程实现了更强的 NTP 性能和输出质量,但未能提供任何自推测解码的优势。

关键词

引用

@article{arxiv.2505.22757,
  title  = {Pre-Training Curriculum for Multi-Token Prediction in Language Models},
  author = {Ansar Aynetdinov and Alan Akbik},
  journal= {arXiv preprint arXiv:2505.22757},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Main)