中文

Pheme: 高效且对话式的语音生成

音频与语音处理 2024-01-08 v1 人工智能 计算与语言

摘要

近年来,语音生成取得了显著进展,现已实现一次性生成能力,其效果往往与真实人声几乎无法区分。将语音生成的这些进步与大型语言模型相结合,可能会彻底改变广泛的应用领域。然而,某些应用(如辅助对话系统)需要自然且对话式的语音生成工具,同时还需具备高效的实时运行能力。当前最先进的模型(如VALL-E和SoundStorm)基于分层神经音频编解码器,需要庞大的神经组件和大量的训练数据才能良好运行。相比之下,MQTTS旨在构建更紧凑的对话式文本转语音(TTS)模型,同时利用较小规模的真实对话语音数据。然而,其自回归特性导致推理延迟较高,从而限制了其实时使用。为了缓解当前最先进TTS模型的局限性,同时发挥其优势,本文引入了Pheme模型系列,该系列:1)提供紧凑且高性能的模型;2)支持并行语音生成;3)生成自然的对话语音;4)能够在小规模对话数据上高效训练,将数据需求降低10倍以上,同时仍能匹配自回归TTS模型的质量。我们还表明,通过简单的师生蒸馏,在预训练的Pheme检查点基础上,仅依赖由更大教师模型生成的合成语音,即可在单说话人设置中显著提升语音质量。音频样本和预训练模型可在线获取。

关键词

引用

@article{arxiv.2401.02839,
  title  = {Pheme: Efficient and Conversational Speech Generation},
  author = {Paweł Budzianowski and Taras Sereda and Tomasz Cichy and Ivan Vulić},
  journal= {arXiv preprint arXiv:2401.02839},
  year   = {2024}
}