中文

VocalNet:面向更快高质量生成的语音 LLM 多标记预测

计算与语言 2025-04-23 v2 人工智能 声音 音频与语音处理

摘要

语音大型语言模型 (LLM) 已成为语音处理领域的热门研究焦点。我们引入 VocalNet-1B 和 VocalNet-8B,一系列高性能、低延迟的语音 LLM,基于可扩展且与模型无关的训练框架,旨在实现实时语音交互。我们的核心贡献是首次将多标记预测 (MTP) 应用于语音 LLM。这种方法代表了从标准后标记预测 (NTP) 的范式转变,同时在生成速度和质量方面取得显著提升。基于对 MTP 对语音生成影响的分析和实验比较,我们设计了一种简单且高效的 MTP 实现方法。实验表明,VocalNet 在有限训练数据下即可与主流 Omni LLM 持水平,显著超越现有开源语音 LLM。为促进可重复性和社区进步,我们已在 https://github.com/SJTU-OmniAgent/VocalNet 上公开所有模型权重、推理代码、训练数据和框架实现。

关键词

引用

@article{arxiv.2504.04060,
  title  = {VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation},
  author = {Yuhao Wang and Heyang Liu and Ziyang Cheng and Ronghua Wu and Qunshan Gu and Yanfeng Wang and Yu Wang},
  journal= {arXiv preprint arXiv:2504.04060},
  year   = {2025}
}