RyanSpeech:面向对话式语音合成语料库
计算与语言
2021-06-17 v1 声音
音频与语音处理
摘要
本文介绍RyanSpeech,一个用于自动化文本到语音(TTS)系统研究的新语音语料库。公开可用的TTS语料库往往含有噪声、由多名说话人录制,或缺乏高质量的男性语音数据。为满足语音识别领域对高质量、公开可用男性语音语料库的需求,我们设计并创建了RyanSpeech,其文本材料来自真实世界的对话场景。这些材料包含一名专业男性配音演员以44.1 kHz录制的超过10小时语音。该语料库的设计与流程使RyanSpeech成为开发真实应用场景中TTS系统的理想选择。为给未来研究、协议和基准提供基线,我们在RyanSpeech上训练了4个最先进的语音模型和一个声码器。结果显示我们最佳模型的平均意见得分(MOS)为3.36。我们已公开该语料库及训练好的模型供公众使用。
引用
@article{arxiv.2106.08468,
title = {RyanSpeech: A Corpus for Conversational Text-to-Speech Synthesis},
author = {Rohola Zandie and Mohammad H. Mahoor and Julia Madsen and Eshrat S. Emamian},
journal= {arXiv preprint arXiv:2106.08468},
year = {2021}
}