Llasa+:基于Llama的加速流式语音合成的免费午餐
声音
2025-08-11 v1 音频与语音处理
摘要
文本到语音(text-to-speech, TTS)的最新进展,尤其是基于大语言模型(large language model, LLM)的方法的发展,已经实现了令人印象深刻的自然度和灵活性。然而,现有的自回归(autoregressive, AR)结构和大规模模型,如Llasa,在推理延迟和流式合成方面仍面临重大挑战。为了解决这些局限性,我们引入了Llasa+,这是一个基于Llasa构建的加速流式TTS模型。具体而言,为了加速生成过程,我们在冻结的主干网络之后引入了两个即插即用的多令牌预测(Multi-Token Prediction, MTP)模块。这些模块允许模型在一个AR步骤中预测多个令牌。此外,为了减轻因不准确的MTP而导致的潜在错误传播,我们设计了一种新颖的验证算法,利用冻结的主干网络来验证生成的令牌,从而使Llasa+能够在加速的同时不牺牲生成质量。此外,我们设计了一个因果解码器,能够从令牌中实现流式语音重建。大量实验表明,尽管仅在LibriTTS上训练,Llasa+仍实现了1.48倍的加速,且不牺牲生成质量。而且,MTP加验证框架可以应用于加速任何基于LLM的模型。所有代码和模型均在https://github.com/ASLP-lab/LLaSA_Plus上公开可用。
引用
@article{arxiv.2508.06262,
title = {Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis},
author = {Wenjie Tian and Xinfa Zhu and Hanke Xie and Zhen Ye and Wei Xue and Lei Xie},
journal= {arXiv preprint arXiv:2508.06262},
year = {2025}
}