超越多标记预测:用未来摘要预训练大语言模型
机器学习
2026-03-26 v2 人工智能
摘要
下一标记预测(NTP)推动了大语言模型(LLM)的成功,但它在长程推理、规划和创意写作方面存在困难,这些局限性主要归因于教师强制训练。多标记预测(MTP)通过一次预测多个未来标记部分缓解了这些问题,但它主要捕获短程依赖关系,改进有限。我们提出未来摘要预测(FSP),它训练一个辅助头来预测长期未来的紧凑表示,从而保留与长文本生成相关的信息。我们探索了 FSP 的两种变体:手工构造的摘要(例如,未来序列的词袋摘要)和学习得到的摘要(其使用由从右到左顺序训练的反向语言模型生成的嵌入)。大规模预训练实验(30 亿和 80 亿参数模型)表明,FSP 在数学、推理和编码基准测试上均优于 NTP 和 MTP。
引用
@article{arxiv.2510.14751,
title = {Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries},
author = {Divyat Mahajan and Sachin Goyal and Badr Youbi Idrissi and Mohammad Pezeshki and Ioannis Mitliagkas and David Lopez-Paz and Kartik Ahuja},
journal= {arXiv preprint arXiv:2510.14751},
year = {2026}
}
备注
Proceedings of the Fourteenth International Conference on Learning Representations (ICLR) 2026