中文

神经编解码语言模型是零样本文本到语音合成器

计算与语言 2023-01-06 v1 声音 音频与语音处理

摘要

我们引入一种用于文本到语音合成(TTS)的语言建模方法。具体而言,我们使用由现成神经音频编解码模型导出的离散码训练一个神经编解码语言模型(称为 Vall-E),并将 TTS 视为条件语言建模任务,而非像以往工作那样作为连续信号回归。在预训练阶段,我们将 TTS 训练数据规模扩大至 60K 小时英语语音,比现有系统大数百倍。Vall-E 涌现出上下文学习能力,仅以未见说话人 3 秒注册录音作为声学提示,即可合成高质量个性化语音。实验结果表明,Vall-E 在语音自然度与说话人相似度方面显著优于最先进的零样本 TTS 系统。此外,我们发现 Vall-E 能在合成中保留声学提示的说话人情感与声学环境。参见 https://aka.ms/valle 查看我们工作的演示。

关键词

引用

@article{arxiv.2301.02111,
  title  = {Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers},
  author = {Chengyi Wang and Sanyuan Chen and Yu Wu and Ziqiang Zhang and Long Zhou and Shujie Liu and Zhuo Chen and Yanqing Liu and Huaming Wang and Jinyu Li and Lei He and Sheng Zhao and Furu Wei},
  journal= {arXiv preprint arXiv:2301.02111},
  year   = {2023}
}

备注

Working in progress