VocalNet:面向更快高质量生成的语音 LLM 多标记预测
计算与语言
2025-04-23 v2 人工智能
声音
音频与语音处理
摘要
语音大型语言模型 (LLM) 已成为语音处理领域的热门研究焦点。我们引入 VocalNet-1B 和 VocalNet-8B,一系列高性能、低延迟的语音 LLM,基于可扩展且与模型无关的训练框架,旨在实现实时语音交互。我们的核心贡献是首次将多标记预测 (MTP) 应用于语音 LLM。这种方法代表了从标准后标记预测 (NTP) 的范式转变,同时在生成速度和质量方面取得显著提升。基于对 MTP 对语音生成影响的分析和实验比较,我们设计了一种简单且高效的 MTP 实现方法。实验表明,VocalNet 在有限训练数据下即可与主流 Omni LLM 持水平,显著超越现有开源语音 LLM。为促进可重复性和社区进步,我们已在 https://github.com/SJTU-OmniAgent/VocalNet 上公开所有模型权重、推理代码、训练数据和框架实现。
引用
@article{arxiv.2504.04060,
title = {VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation},
author = {Yuhao Wang and Heyang Liu and Ziyang Cheng and Ronghua Wu and Qunshan Gu and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2504.04060},
year = {2025}
}