中文

MarginGate:稀疏边际触发的批量不变 LLM 推理验证

机器学习 2026-05-29 v1 性能

摘要

温度为零的 BF16 LLM 推理常被视为可重复,但相同的请求在单独解码还是包含在更大 batch 中时会产生不同的 token。现有的修复方法使用 batch-invariant operator 或 LLM-42 的 per-token 验证,即使大多数步骤都稳定也要付出代价。我们提出:验证能否仅应用于翻转的 token?在五个模型上,batch 引起的 token 翻转在 flip-rate benchmark 上稀疏:在 MATH500 上,Llama-3.1-8B 在同步解码步骤中仅翻转 0.48%0.48\%,所有测试模型在 MATH500、GSM8K 和 HumanEval 上都保持在 0.3-1.3% 范围内。K/V 扰动在翻转之前保持平稳,而低 top-1/top-2 logit 边际暴露了大部分翻转风险。MarginGate 将这些观察转化为验证策略:它在 high-margin 步骤上保持 BF16 解码,仅对 low-margin 步骤进行验证,并通过替换当前 K/V 列来修复确认的不匹配。我们在四个数据集上评估了该方法,在 MATH500 上校准并在 GSM8K、SharedGPT 和 HumanEval 上迁移。MarginGate 在 Llama-3.1-8B 和 Qwen2.5-14B 上恢复 100% 的序列级确定性解码,分别仅触发 18.56%/15.05% 的验证器,使 LLM-42 的延迟增量相对于始终启用验证分别降低 2.23x/1.99x。在 DSR1-Distill-Qwen-7B 上,同一策略在更具挑战性的情境中以 49.50% 的触发率实现确定性。

关键词

引用

@article{arxiv.2605.30218,
  title  = {MarginGate: Sparse Margin-Triggered Verification for Batch-Invariant LLM Inference},
  author = {Kexin Chu and Yang Zhou and Wei Zhang},
  journal= {arXiv preprint arXiv:2605.30218},
  year   = {2026}
}

备注

13 pages, 5 figures, 11 tables