中文

VibeVoice 技术报告

计算与语言 2025-08-27 v1 人工智能 声音 音频与语音处理

摘要

本报告介绍VibeVoice,这是一个旨在通过采用下一令牌扩散来合成多说话人长篇语音的新模型。下一令牌扩散是一种通过扩散自回归生成潜在向量来对连续数据进行建模的统一方法。为实现此目标,我们引入了一种新颖的连续语音分词器,与流行的Encodec模型相比,该分词器在保持相当性能的同时,将数据压缩率提升了80倍。该分词器有效保留了音频保真度,同时显著提高了处理长序列的计算效率。因此,VibeVoice能够合成最长90分钟(在64K上下文窗口长度内)、最多4个说话人的长篇语音,捕捉真实的对话“氛围”,并超越了开源和专有的对话模型。

关键词

引用

@article{arxiv.2508.19205,
  title  = {VibeVoice Technical Report},
  author = {Zhiliang Peng and Jianwei Yu and Wenhui Wang and Yaoyao Chang and Yutao Sun and Li Dong and Yi Zhu and Weijiang Xu and Hangbo Bao and Zehua Wang and Shaohan Huang and Yan Xia and Furu Wei},
  journal= {arXiv preprint arXiv:2508.19205},
  year   = {2025}
}