中文

面向低资源语言的音素丰富语料库构建

计算与语言 2024-02-09 v1 人工智能

摘要

语音技术依赖于在获取全面语言信息的同时捕捉说话人的声音变异性。文献中已提出了文本提示和句子选择方法,以包含这种充分的语音数据,即所谓的音素丰富语料库 (phonetically rich corpus)。然而,它们对于声学建模仍然不足,这对于资源有限的语言尤为关键。因此,本文提出了一种新方法,并概述了为低资源语言(巴西葡萄牙语)创建具有广泛音素覆盖的语料库所需的方法论方面。我们的方法包括文本数据集收集,直至基于三音子分布的句子选择算法。此外,我们提出了一种新的音位分类法,依据声学 - 发音语音特征,因为不同三音子的绝对数量或低概率三音子并不能保证对每种可能组合的充分表示。使用我们的算法,对于相似大小的样本,我们实现了高出 55.8% 的不同三音子百分比;而目前可用的音素丰富语料库 CETUC 和 TTS-Portuguese,与非音素丰富数据集相比,分别仅为 12.6% 和 12.3%。

关键词

引用

@article{arxiv.2402.05794,
  title  = {Phonetically rich corpus construction for a low-resourced language},
  author = {Marcellus Amadeus and William Alberto Cruz Castañeda and Wilmer Lobato and Niasche Aquino},
  journal= {arXiv preprint arXiv:2402.05794},
  year   = {2024}
}