中文

MARS:通过边际感知验证释放投机解码的潜力

机器学习 2026-04-14 v2

摘要

投机解码通过将生成与验证解耦来加速自回归大语言模型(LLM)的推理。虽然最近的方法通过将草稿器与目标模型紧密耦合来提高草稿质量,但验证机制本身在很大程度上保持不变,依赖于严格的 token 级拒绝采样。在实践中,现代 LLM 通常运行在低边际区间,即目标模型在顶级候选 token 之间表现出微弱的偏好。在这种情况下,拒绝合理的次优 token 产生的信息增益微乎其微,同时却带来大量的回滚成本,导致验证环节的根本性低效。我们提出了边际感知投机验证,这是一种无需训练且与领域无关的验证策略,能够适应目标模型的局部决断性。我们的方法将验证条件化为直接从目标 logits 测量的决策稳定性,并仅在严格验证提供的收益最小时放宽拒绝。重要的是,该方法仅修改验证规则,与现有的目标耦合投机解码框架完全兼容。在 8B 到 235B 的模型规模上进行的广泛实验表明,我们的方法在保持跨多种基准测试生成质量的同时,相比最先进的基线提供了一致且显著的推理加速。代码可在 https://github.com/5SSjw/MARS 获取。

关键词

引用

@article{arxiv.2601.15498,
  title  = {MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification},
  author = {Jingwei Song and Xinyu Wang and Hanbin Wang and Xiaoxuan Lei and Bill Shi and Shixin Han and Eric Yang and Xiao-Wen Chang and Lynn Ai},
  journal= {arXiv preprint arXiv:2601.15498},
  year   = {2026}
}

备注

12 pages, 4 figures, 7 tables