LibriTTS-R:一个修复后的多说话人文本到语音语料库
音频与语音处理
2023-05-31 v1 声音
摘要
本文介绍了一个专为文本到语音(TTS)使用而设计的新语音数据集“LibriTTS-R”。它通过对 LibriTTS 语料库施加语音修复得到,该语料库包含来自 2,456 个说话人、采样率 24 kHz 的 585 小时语音数据及对应文本。LibriTTS-R 的组成样本与 LibriTTS 完全相同,仅提升了音质。实验结果表明,LibriTTS-R 的真值样本相较 LibriTTS 中的样本音质显著提升。此外,用 LibriTTS-R 训练的端到端神经 TTS 所取得的语音自然度与真值样本相当。该语料库可自由从 \url{http://www.openslr.org/141/} 下载。
引用
@article{arxiv.2305.18802,
title = {LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus},
author = {Yuma Koizumi and Heiga Zen and Shigeki Karita and Yifan Ding and Kohei Yatabe and Nobuyuki Morioka and Michiel Bacchiani and Yu Zhang and Wei Han and Ankur Bapna},
journal= {arXiv preprint arXiv:2305.18802},
year = {2023}
}
备注
Accepted to Interspeech 2023