DynaMo:基于动态多 Token 采样的语言模型推理加速
计算与语言
2024-05-03 v1
摘要
传统语言模型以自回归方式运行,即每次预测一个 token。模型规模的迅速膨胀导致推理时间过长。在本工作中,我们提出了 DynaMo,一套多 token 预测语言模型,旨在减少净推理时间。我们的模型根据对预测联合概率分布的置信度,预测多个 token。我们提出了一种轻量级技术,利用传统自回归对应模型的权重来训练这些模型。此外,我们提出了增强估计联合概率以提升文本生成质量的新方法,即共现加权掩码和自适应阈值化。我们还提出了系统性的定性和定量方法,以严格测试非自回归生成文本的质量。我们套件中的模型之一 DynaMo-7.3B-T3,在生成与基线 (Pythia-6.9B) 相同质量文本的同时,实现了 2.57 倍的加速,且参数和训练时间开销分别仅为 5.87% 和 2.67%。
关键词
引用
@article{arxiv.2405.00888,
title = {DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling},
author = {Shikhar Tuli and Chi-Heng Lin and Yen-Chang Hsu and Niraj K. Jha and Yilin Shen and Hongxia Jin},
journal= {arXiv preprint arXiv:2405.00888},
year = {2024}
}
备注
Accepted at NAACL 2024