中文

多标记预测需要寄存器

计算与语言 2025-05-16 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

多标记预测作为改进语言模型预训练的一种前景目标,但其收益在其他设置(如微调)中并未持续普遍。本文提出 MuToR,一种简单有效的多标记预测方法,通过在输入序列中交错插入可学习的寄存器标记,每个标记负责预测未来目标。与现有方法相比,MuToR 具有若干关键优势:仅引入极少的额外参数,无需架构更改——确保与即插即用预训练语言模型兼容——且保持与下一个标记预训练目标的一致性,特别适用于监督式微调。此外,它自然支持可扩展的预测时域。我们在语言和视觉领域的多种用例中展示了 MuToR 的有效性和通用性,包括监督式微调、参数高效微调(PEFT)和预训练,涵盖语言和视觉领域的具有挑战性的生成任务。我们的代码将在:https://github.com/nasosger/MuToR 上提供。

关键词

引用

@article{arxiv.2505.10518,
  title  = {Multi-Token Prediction Needs Registers},
  author = {Anastasios Gerontopoulos and Spyros Gidaris and Nikos Komodakis},
  journal= {arXiv preprint arXiv:2505.10518},
  year   = {2025}
}