PredGen:基于输入时猜测的大型语言模型加速推理框架用于实时语音交互
计算与语言
2025-10-09 v2 声音
音频与语音处理
摘要
大型语言模型(LLM)在实时语音聊天应用中广泛使用,通常结合文本转语音(TTS)系统生成音频响应。然而,其庞大尺寸常导致用户输入结束至音频输出开始之间出现可感知的延迟,造成次优的用户体验。这种延迟在LLM作为消费级硬件上单用户语音助理部署时尤为明显。我们发现,这一延迟主要由LLM生成第一个句子所需时间决定,该句子是TTS系统基于句子级处理合成音频响应所必需的输入。为解决这一瓶颈,我们提出预测生成(PredGen),一种新颖的框架,通过输入时推测性解码来缓解或甚至消除此延迟。在用户持续说话期间,PredGen生成候选响应,使TTS处理可在几乎无延迟的情况下启动。在Lmsys和MT-Bench数据集上的模拟实验表明,所提出的方法可在广泛的用例中将延迟约降低50%,同时仅增加极少的额外计算开销——这种计算本来在输入时段就会被浪费。
引用
@article{arxiv.2506.15556,
title = {PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction},
author = {Shufan Li and Aditya Grover},
journal= {arXiv preprint arXiv:2506.15556},
year = {2025}
}
备注
16 pages,4 figures