巴哈语语调和:面向离散编解码器的巴哈语文本到语音综合数据集
声音
2024-10-10 v1 人工智能
音频与语音处理
摘要
本研究引入了一个全面的巴哈语文本到语音(TTS)数据集和一个新型TTS模型EnGen-TTS,旨�提升合成语音在巴哈语中的质量和多样性。数据集覆盖约55.0小时和52K个音频录音,集成多样化文本来源,确保语言丰富性。严格的录音 setup 捕捉巴哈语语音的细微差别,采用专业设备确保高保真音频样本。统计分析揭示数据集的规模和多样性,为模型训练和评估奠定基础。所提出的EnGen-TTS模型优于既有基线,实现Mean Opinion Score(MOS)为4.45 0.13。此外,我们对实时因数和模型规模的调查表明,EnGen-TTS是富有吸引力的选择,具备高效性能。这一研究在巴哈语TTS技术方面标志着重大进展,具有多语言应用的前景。生成样本链接: \url{https://bahasa-harmony-comp.vercel.app/}。
引用
@article{arxiv.2410.06608,
title = {Bahasa Harmony: A Comprehensive Dataset for Bahasa Text-to-Speech Synthesis with Discrete Codec Modeling of EnGen-TTS},
author = {Onkar Kishor Susladkar and Vishesh Tripathi and Biddwan Ahmed},
journal= {arXiv preprint arXiv:2410.06608},
year = {2024}
}