中文

说话、阅读与提示:极小监督下的高保真文本转语音

声音 2023-02-08 v1 音频与语音处理

摘要

我们提出了 SPEAR-TTS,一种可以以极小监督进行训练的多说话人文本转语音(TTS)系统。通过结合两类离散语音表示,我们将 TTS 构建为两个序列到序列任务的组合:从文本到高层语义 token(类似于“阅读”)以及从语义 token 到低层声学 token(“说话”)。解耦这两个任务使得能够利用丰富的纯音频数据训练“说话”模块,并解锁了预训练与回译的高效组合,从而在训练“阅读”组件时减少对平行数据的需求。为控制说话人身份,我们采用示例提示(example prompting),使得 SPEAR-TTS 仅使用 3 秒短样本即可泛化至未见说话人,无需任何显式说话人表示或说话人 ID 标签。我们的实验表明,SPEAR-TTS 仅使用 15 分钟平行数据便取得了与最先进方法相竞争的字符错误率,同时在自然度与声学质量上匹配真实语音(于主观测试中测得)。

关键词

引用

@article{arxiv.2302.03540,
  title  = {Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision},
  author = {Eugene Kharitonov and Damien Vincent and Zalán Borsos and Raphaël Marinier and Sertan Girgin and Olivier Pietquin and Matt Sharifi and Marco Tagliasacchi and Neil Zeghidour},
  journal= {arXiv preprint arXiv:2302.03540},
  year   = {2023}
}