多标记预测需要寄存器
计算与语言
2025-05-16 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
多标记预测作为改进语言模型预训练的一种前景目标,但其收益在其他设置(如微调)中并未持续普遍。本文提出 MuToR,一种简单有效的多标记预测方法,通过在输入序列中交错插入可学习的寄存器标记,每个标记负责预测未来目标。与现有方法相比,MuToR 具有若干关键优势:仅引入极少的额外参数,无需架构更改——确保与即插即用预训练语言模型兼容——且保持与下一个标记预训练目标的一致性,特别适用于监督式微调。此外,它自然支持可扩展的预测时域。我们在语言和视觉领域的多种用例中展示了 MuToR 的有效性和通用性,包括监督式微调、参数高效微调(PEFT)和预训练,涵盖语言和视觉领域的具有挑战性的生成任务。我们的代码将在:https://github.com/nasosger/MuToR 上提供。
引用
@article{arxiv.2505.10518,
title = {Multi-Token Prediction Needs Registers},
author = {Anastasios Gerontopoulos and Spyros Gidaris and Nikos Komodakis},
journal= {arXiv preprint arXiv:2505.10518},
year = {2025}
}