面向高效LLM推理的多token预测
计算与语言
2025-02-14 v1 机器学习
摘要
我们系统性地研究了在为下一token预测(NTP)预训练的LLM中集成多token预测(MTP)能力。首先,我们表明此类模型通过对中间token概率进行数值边际化天然具备MTP能力,尽管其性能依赖于数据且随模型规模而提升。进一步,我们探讨了将MTP头集成到冻结LLM中的挑战,发现其隐藏层对NTP具有强大的专化,使适配性非平凡。最后,我们表明尽管联合训练MTP头与主干网络可提升性能,但无法完全克服这一障碍,促使进一步的研究。我们的发现深化了对预训练LLM上MTP的理解,为通过并行token预测加速推理提供了策略指导。
引用
@article{arxiv.2502.09419,
title = {On multi-token prediction for efficient LLM inference},
author = {Somesh Mehra and Javier Alonso Garcia and Lukas Mauch},
journal= {arXiv preprint arXiv:2502.09419},
year = {2025}
}