AdaEDL: 基于熵的令牌接受概率下界实现大语言模型推测解码的早期草稿停止
计算与语言
2024-10-25 v1 机器学习
摘要
推测解码是一种强大的技术,旨在规避现代大语言模型(LLM)的自回归约束。推测解码技术的目标是通过使用更高效的草稿模型提出草稿令牌,然后并行验证这些令牌,从而提高大型目标模型的平均推理时间,同时不牺牲其准确性。每轮草稿生成中产生的草稿令牌数量称为草稿长度,通常是一个基于草稿令牌接受率统计信息选择的静态超参数。然而,设置静态草稿长度可能会对性能产生负面影响,尤其是在草稿生成成本高昂且接受的令牌数量方差很大的情况下。自适应基于熵的草稿长度(AdaEDL)是一种简单、无需训练和参数的标准,它通过基于当前观察到的草稿logits的熵来近似草稿令牌预期接受概率的下界,从而允许提前停止令牌草稿生成过程。我们表明,在各种设置和数据集上,AdaEDL 始终优于静态草稿长度的推测解码 10%-57%,并且优于其他无需训练的草稿停止技术高达 10%。同时,我们表明 AdaEDL 比这些技术更鲁棒,并且在高温采样场景下也能保持性能。由于它无需训练,与依赖训练特定数据集草稿停止预测器的技术相比,AdaEDL 可以无缝集成到各种现有的大语言模型系统中。
引用
@article{arxiv.2410.18351,
title = {AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability},
author = {Sudhanshu Agrawal and Wonseok Jeon and Mingu Lee},
journal= {arXiv preprint arXiv:2410.18351},
year = {2024}
}
备注
Workshop on Efficient Natural Language and Signal Processing at NeurIPS 2024