中文

DynaMo:基于动态多 Token 采样的语言模型推理加速

计算与语言 2024-05-03 v1

摘要

传统语言模型以自回归方式运行,即每次预测一个 token。模型规模的迅速膨胀导致推理时间过长。在本工作中,我们提出了 DynaMo,一套多 token 预测语言模型,旨在减少净推理时间。我们的模型根据对预测联合概率分布的置信度,动态地\textit{动态地}预测多个 token。我们提出了一种轻量级技术,利用传统自回归对应模型的权重来训练这些模型。此外,我们提出了增强估计联合概率以提升文本生成质量的新方法,即共现加权掩码和自适应阈值化。我们还提出了系统性的定性和定量方法,以严格测试非自回归生成文本的质量。我们套件中的模型之一 DynaMo-7.3B-T3,在生成与基线 (Pythia-6.9B) 相同质量文本的同时,实现了 2.57 倍的加速,且参数和训练时间开销分别仅为 5.87% 和 2.67%。

关键词

引用

@article{arxiv.2405.00888,
  title  = {DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling},
  author = {Shikhar Tuli and Chi-Heng Lin and Yen-Chang Hsu and Niraj K. Jha and Yilin Shen and Hongxia Jin},
  journal= {arXiv preprint arXiv:2405.00888},
  year   = {2024}
}

备注

Accepted at NAACL 2024