中文

预测后续词元顺序可改善语言建模

机器学习 2026-02-17 v2

摘要

多词元预测(MTP)已被提出作为辅助目标,以改进语言模型训练中的下一词元预测(NTP),但其表现出的改进并不一致,在标准自然语言处理基准测试中表现不佳。我们发现,MTP 的精确未来词元预测作为辅助损失过于困难。因此,我们提出词元顺序预测(TOP),该方法使用学习排序损失来训练模型根据邻近程度对即将出现的词元进行排序。与 MTP 的多个 Transformer 层相比,TOP 仅需一个额外的解嵌入层。我们使用 NTP、MTP、DeepSeek MTP(DS-MTP)和 TOP 目标预训练了参数规模为 3.4 亿、18 亿和 70 亿的模型。九个标准自然语言处理基准测试的结果表明,即使在大规模下,TOP 总体上仍优于 NTP、MTP 和 DS-MTP。在数学和代码上继续训练的 TOP 模型在 4 个相关基准测试中也表现更好。在合成星图任务中,TOP 能够在 NTP、MTP 和 DS-MTP 失败的图上进行寻路。我们的代码可在 https://github.com/zaydzuhri/token-order-prediction 获取。

关键词

引用

@article{arxiv.2508.19228,
  title  = {Predicting the Order of Upcoming Tokens Improves Language Modeling},
  author = {Zayd M. K. Zuhri and Erland Hilman Fuadi and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2508.19228},
  year   = {2026}
}