语言模型中多 Token 预测的预训练课程
计算与语言
2025-05-30 v1 人工智能
摘要
多 Token 预测 (MTP) 是近期提出的一种语言模型预训练目标。MTP 不再仅预测下一个 Token (NTP),而是使用多个预测头在每个预测步骤中预测接下来的 个 Token。MTP 在提升下游性能、推理速度和训练效率方面展现出潜力,尤其对于大模型而言。然而,先前的工作表明,小型语言模型 (SLMs) 在 MTP 目标上存在困难。为了解决这一问题,我们提出了一种用于 MTP 训练的课程学习策略,并探索了两种变体:一种正向课程,将预训练目标的复杂性从 NTP 逐步增加到 MTP;以及一种反向课程,执行相反的操作。我们的实验表明,正向课程使 SLMs 能够在预训练期间更好地利用 MTP 目标,提升了下游 NTP 性能和生成输出质量,同时保留了自推测解码的优势。反向课程实现了更强的 NTP 性能和输出质量,但未能提供任何自推测解码的优势。
引用
@article{arxiv.2505.22757,
title = {Pre-Training Curriculum for Multi-Token Prediction in Language Models},
author = {Ansar Aynetdinov and Alan Akbik},
journal= {arXiv preprint arXiv:2505.22757},
year = {2025}
}
备注
Accepted to ACL 2025 (Main)