VocalNet-M2:通过集成多码本分词与多标记预测实现低延迟口语语言建模
计算与语言
2025-11-14 v1 人工智能
声音
摘要
当前的端到端口语语言模型(SLMs)已取得显著进展,但仍面临较大的响应延迟。这种延迟主要源于语音标记的自回归生成以及依赖复杂流匹配模型的语音合成。为克服此问题,我们引入 VocalNet-M2,这是一个新型低延迟 SLM,集成了多码本分词器和多标记预测(MTP)策略。该模型直接生成多码本语音标记,从而消除依赖导致延迟的流匹配模型的需求。此外,我们的 MTP 策略提高了生成效率并提升了整体性能。大量实验表明,VocalNet-M2 在首个语音块延迟(从约 725ms 降至 350ms)方面实现了显著减少,同时在主流 SLMs 上保持了具竞争力的性能。本工作还提供了单码本与多码本策略的全面比较,为开发高效且高性能的实时交互式 SLMs 提供了宝贵的见解。
引用
@article{arxiv.2511.10232,
title = {VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction},
author = {Yuhao Wang and Ziyang Cheng and Heyang Liu and Ronghua Wu and Qunshan Gu and Yanfeng Wang and Yu Wang},
journal= {arXiv preprint arXiv:2511.10232},
year = {2025}
}