基于动态树注意力的LLM多头解码加速
计算机视觉与模式识别
2025-02-11 v1 计算与语言
摘要
多头解码通过预测下一个多个标记来加速大语言模型(LLM)的推理, 通过固定结构的树注意力并行生成和验证多个候选序列。在本文中,我们将固定树注意力替换为多头解码中的动态树注意力,具体而言是在MEDUSA上下文中实现。我们提出了一种简单且计算复杂度低的策略,用于生成候选者并构建动态树结构。初步实验表明,所提方法在保持生成质量的同时,提高了多头解码LLM的解码效率。这一结果表明了多头解码在候选生成方面的潜在改进。
引用
@article{arxiv.2502.05947,
title = {Acceleration Multiple Heads Decoding for LLM via Dynamic Tree Attention},
author = {Zhendong Zhang},
journal= {arXiv preprint arXiv:2502.05947},
year = {2025}
}