MARS:使自回归模型支持多令牌生成
计算与语言
2026-04-09 v1
摘要
自回归(AR)语言模型逐个生成令牌,即使在给定先前上下文的情况下连续令牌高度可预测时也是如此。我们引入MARS(Mask AutoRegreSsion),一种轻量级微调方法,教会经过指令调优的AR模型在每个前向传播中预测多个令牌。MARS不添加任何架构修改,不增加额外参数,并生成一个仍可像原始AR模型一样精确调用的模型,且无性能退化。与推测解码(维护单独的草稿模型 alongside 目标模型)或Medusa等多头方法(附加额外的预测头)不同,MARS仅需在现有指令数据上继续训练。当每个前向传播生成一个令牌时,MARS在六个标准基准上匹配或超过AR基线。当允许每步接受多个令牌时,它在保持基线级准确率的同时实现1.5–1.7倍吞吐量。我们进一步开发了用于批量推理的块级KV缓存策略,在Qwen2.5-7B上实现高达1.71倍的墙钟速度提升。最后,MARS支持通过置信度阈值进行实时速度调整:在高请求负载下,服务系统可以随时提高吞吐量而无需切换模型或重启,为部署提供了实用的延迟-质量调节旋钮。
引用
@article{arxiv.2604.07023,
title = {MARS: Enabling Autoregressive Models Multi-Token Generation},
author = {Ziqi Jin and Lei Wang and Ziwei Luo and Aixin Sun},
journal= {arXiv preprint arXiv:2604.07023},
year = {2026}
}
备注
15 pages, 4 fugures