中文

MARS:使自回归模型支持多令牌生成

计算与语言 2026-04-09 v1

摘要

自回归(AR)语言模型逐个生成令牌,即使在给定先前上下文的情况下连续令牌高度可预测时也是如此。我们引入MARS(Mask AutoRegreSsion),一种轻量级微调方法,教会经过指令调优的AR模型在每个前向传播中预测多个令牌。MARS不添加任何架构修改,不增加额外参数,并生成一个仍可像原始AR模型一样精确调用的模型,且无性能退化。与推测解码(维护单独的草稿模型 alongside 目标模型)或Medusa等多头方法(附加额外的预测头)不同,MARS仅需在现有指令数据上继续训练。当每个前向传播生成一个令牌时,MARS在六个标准基准上匹配或超过AR基线。当允许每步接受多个令牌时,它在保持基线级准确率的同时实现1.5–1.7倍吞吐量。我们进一步开发了用于批量推理的块级KV缓存策略,在Qwen2.5-7B上实现高达1.71倍的墙钟速度提升。最后,MARS支持通过置信度阈值进行实时速度调整:在高请求负载下,服务系统可以随时提高吞吐量而无需切换模型或重启,为部署提供了实用的延迟-质量调节旋钮。

关键词

引用

@article{arxiv.2604.07023,
  title  = {MARS: Enabling Autoregressive Models Multi-Token Generation},
  author = {Ziqi Jin and Lei Wang and Ziwei Luo and Aixin Sun},
  journal= {arXiv preprint arXiv:2604.07023},
  year   = {2026}
}

备注

15 pages, 4 fugures