IMaSC——ICFOSS 马来语语音语料库
声音
2022-11-24 v1 计算与语言
音频与语音处理
摘要
现代文本到语音(TTS)系统使用深度学习来合成日益接近人类质量的语音,但它们需要高质量的音频-文本句子对数据库用于训练。马拉雅拉姆语是印度喀拉拉邦的官方语言,有 3500 多万使用者,就可用于 TTS 系统的语料库而言是一种低资源语言。在本文中,我们呈现 IMaSC,一个包含约 50 小时录音语音的马拉雅拉姆语文本与语音语料库。凭借 8 位说话人和总计 34,473 个文本-音频对,IMaSC 比任何其他公开可用替代语料库都更大。我们通过使用它基于现代深度学习架构为每个说话人训练 TTS 模型来评估该数据库。通过主观评价,我们表明我们的模型在自然度方面相比先前研究和公开可用模型表现显著更优,平均主观意见得分为 4.50,表明合成语音接近人类质量。
引用
@article{arxiv.2211.12796,
title = {IMaSC -- ICFOSS Malayalam Speech Corpus},
author = {Deepa P Gopinath and Thennal D K and Vrinda V Nair and Swaraj K S and Sachin G},
journal= {arXiv preprint arXiv:2211.12796},
year = {2022}
}
备注
18 pages, 8 figures