中文

Cactus:基于受限接受性推测采样加速自回归解码

机器学习 2026-04-08 v1 人工智能 最优化与控制 机器学习

摘要

推测采样 (SpS) 通过利用较小的草稿模型成功地加快了自回归大语言模型的解码吞吐量。SpS 严格强制生成的分布与验证器 LLM 的分布相匹配。这一要求显得过于严格,因为对验证器分布的轻微变动(例如使用 top-kk 或温度采样)也同样可接受。典型的接受采样 (TAS) 通过基于熵的启发式方法接受更多的 token,但这种方法会扭曲验证器分布,可能在验证器编码关键信息时降低输出质量。本文通过约束优化的视角形式化推测采样算法。基于此表述,我们提出了 Cactus (constrained acceptance speculative sampling),一种保证控制与验证器分布的发散程度并提高接受率的方法。广泛的基准测试结果证明了该方法的有效性。

关键词

引用

@article{arxiv.2604.04987,
  title  = {Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling},
  author = {Yongchang Hao and Lili Mou},
  journal= {arXiv preprint arXiv:2604.04987},
  year   = {2026}
}

备注

Camera-ready version. Accepted at ICLR 2026