SpeechGPT-Gen:扩展信息链式语音生成
计算与语言
2024-01-26 v2 声音
音频与语音处理
摘要
得益于有效的语音建模,当前的语音大语言模型(SLLMs)在上下文语音生成和对未见过的说话人的高效泛化方面展现了卓越的能力。然而,主流的信息建模过程受到某些冗余的阻碍,导致语音生成效率低下。我们提出了信息链式生成(CoIG),这是一种在大规模语音生成中解耦语义信息和感知信息的方法。在此基础上,我们开发了 SpeechGPT-Gen,一个拥有 80 亿参数、在语义和感知信息建模方面高效的 SLLM。它包含一个基于 LLM 的自回归模型用于语义信息建模,以及一个采用流匹配的非自回归模型用于感知信息建模。此外,我们引入了将语义信息注入先验分布的新方法,以提高流匹配的效率。大量的实验结果表明,SpeechGPT-Gen 在零样本文本到语音合成、零样本语音转换和语音到语音对话方面表现显著出色,突显了 CoIG 在捕获和建模语音的语义和感知维度方面的卓越能力。代码和模型可在 https://github.com/0nutation/SpeechGPT 获取。
引用
@article{arxiv.2401.13527,
title = {SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation},
author = {Dong Zhang and Xin Zhang and Jun Zhan and Shimin Li and Yaqian Zhou and Xipeng Qiu},
journal= {arXiv preprint arXiv:2401.13527},
year = {2024}
}
备注
work in progress