中文

VALL-E 2:神经编解码器语言模型达到人类水平的零样文本到语音合成器

计算与语言 2024-06-18 v2 声音 音频与语音处理

摘要

本文介绍了 VALL-E 2,这是神经编解码器语言模型的最新进展,标志着零样文本到语音合成(TTS)实现人类水平的里程碑。基于其前身 VALL-E,新版本引入了两个重要改进:重复感知抽样细化了原始核抽样过程,考虑到解码历史中的标记重复。这不仅稳定了解码,还规避了无限循环问题。分组编解码建模将编解码器代码组织成组,从而有效缩短序列长度,这不仅加快了推理速度,也解决了长序列建模的挑战。我们在 LibriSpeech 和 VCTK 数据集上的实验表明,VALL-E 2 在语音稳健性、自然度和说话人相似性方面超越了之前的系统。这是首个在这些基准上达到人类水平的系统。此外,VALL-E 2 即使针对传统上因其复杂性或重复短语而具有挑战的句子,也能持续合成高质量语音。本工作的优势可能为诸如为具有瘙痒症患者或肌萎缩性肌萎缩症患者生成语音等有价值的任务提供贡献。详见 https://aka.ms/valle2 查看 VALL-E 2 演示。

关键词

引用

@article{arxiv.2406.05370,
  title  = {VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers},
  author = {Sanyuan Chen and Shujie Liu and Long Zhou and Yanqing Liu and Xu Tan and Jinyu Li and Sheng Zhao and Yao Qian and Furu Wei},
  journal= {arXiv preprint arXiv:2406.05370},
  year   = {2024}
}

备注

Demo posted