中文

巴哈语语调和:面向离散编解码器的巴哈语文本到语音综合数据集

声音 2024-10-10 v1 人工智能 音频与语音处理

摘要

本研究引入了一个全面的巴哈语文本到语音(TTS)数据集和一个新型TTS模型EnGen-TTS,旨�提升合成语音在巴哈语中的质量和多样性。数据集覆盖约55.0小时和52K个音频录音,集成多样化文本来源,确保语言丰富性。严格的录音 setup 捕捉巴哈语语音的细微差别,采用专业设备确保高保真音频样本。统计分析揭示数据集的规模和多样性,为模型训练和评估奠定基础。所提出的EnGen-TTS模型优于既有基线,实现Mean Opinion Score(MOS)为4.45 ±\pm 0.13。此外,我们对实时因数和模型规模的调查表明,EnGen-TTS是富有吸引力的选择,具备高效性能。这一研究在巴哈语TTS技术方面标志着重大进展,具有多语言应用的前景。生成样本链接: \url{https://bahasa-harmony-comp.vercel.app/}。

关键词

引用

@article{arxiv.2410.06608,
  title  = {Bahasa Harmony: A Comprehensive Dataset for Bahasa Text-to-Speech Synthesis with Discrete Codec Modeling of EnGen-TTS},
  author = {Onkar Kishor Susladkar and Vishesh Tripathi and Biddwan Ahmed},
  journal= {arXiv preprint arXiv:2410.06608},
  year   = {2024}
}