中文

LLMVoX:面向任意大语言模型的自回归流式文本转语音模型

计算与语言 2025-03-07 v1

摘要

近期语音语音对话系统的进展致力于利用大语言模型实现多模态交互,但仍受制于微调需求、计算开销高及文本语音错位等问题。现有语音化大语言模型常通过修改大语言模型来实现语音功能,从而损害其语言能力。相反,我们提出LLMVoX,一种轻量级3000万参数、无关大语言模型的自回归流式语音合成系统,能够以低延迟生成高质量语音,同时完全保留基础大语言模型的能力。我们的方法在语音化大语言模型中实现了显著更低的词错误率,同时在可比的延迟和UTMOS评分下表现良好。通过采用多队列token流式系统,将语音合成与大语言模型处理解耦,LLMVoX支持无缝、无限长度的对话。其即插即用设计也便于扩展到各种任务。此外,LLMVoX仅需数据集适配即可泛化到新语言,在阿拉伯语语音任务中实现了较低的字符错误率。我们还将LLMVoX集成到视觉语言模型中,构建了一个具备语音、文本和视觉能力的全模态模型,无需额外的多模态训练。我们的代码和项目页面可在 https://mbzuai-oryx.github.io/LLMVoX 查看。

关键词

引用

@article{arxiv.2503.04724,
  title  = {LLMVoX: Autoregressive Streaming Text-to-Speech Model for Any LLM},
  author = {Sambal Shikhar and Mohammed Irfan Kurpath and Sahal Shaji Mullappilly and Jean Lahoud and Fahad Khan and Rao Muhammad Anwer and Salman Khan and Hisham Cholakkal},
  journal= {arXiv preprint arXiv:2503.04724},
  year   = {2025}
}