中文

BiTA:面向大语言模型无损加速的双向调优

计算与语言 2025-07-02 v2 人工智能 机器学习

摘要

大语言模型(LLMs)在推理过程中通常采用自回归生成,导致高内存带宽需求并因此延长延迟。为缓解这种低效,我们提出了双向调优无损加速(BiTA),这是一种通过简化的半自回归生成和草稿验证来加速LLMs的创新方法。受提示调优概念的启发,我们通过一种称为双向调优的参数高效设计来增强LLM的半自回归生成能力。利用高效的基于树的解码,模型并行执行候选草稿生成和验证,确保在贪婪采样下输出与其自回归对应物完全相同。BiTA作为一个轻量级即插即用模块,无需额外的辅助模型或产生显著的额外内存成本,即可无缝提升现有LLMs的推理效率。应用所提出的BiTA,LLaMA-2-70B-Chat在MT-Bench基准测试上实现了2.7倍的加速。大量实验证实,我们的方法超越了最先进的加速技术。

关键词

引用

@article{arxiv.2401.12522,
  title  = {BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models},
  author = {Feng Lin and Hanling Yi and Hongbin Li and Yifan Yang and Xiaotian Yu and Guangming Lu and Rong Xiao},
  journal= {arXiv preprint arXiv:2401.12522},
  year   = {2025}
}

备注

An appendix has been included. Source code at https://github.com/linfeng93/BiTA