中文

面向资源极度匮乏马里语种的 ASR 多语言训练集选择

音频与语音处理 2021-08-16 v1

摘要

我们提出了两种极度资源匮乏的马里语言 Bambara 和 Maasina Fulfulde 的首个语音识别系统。这些系统将被联合国用作监测和支援非洲农村人道主义项目的系统的一部分。我们已编译了 Bambara 和 Maasina Fulfulde 的数据集,但由于这些数据集非常小,我们利用其他六种同样资源匮乏的语言数据集进行多语言训练。我们特别关注用于多语言训练的多语言语音数据池的最佳构成。我们发现,尽管通过纳入全部六种附加语言来最大化训练池可改善两种目标语言的语音识别,但通过更审慎的选择可获得明显更优的性能。我们的实验表明,仅添加一种语言即可提供最佳性能。对于 Bambara,该附加语言为 Maasina Fulfulde,其引入带来了 6.7% 的相对词错误率下降,而汇集全部六种附加语言时仅实现 2.4% 的相对下降。对于 Maasina Fulfulde,仅添加 Luganda 时取得最佳性能,带来 9.4% 的相对词错误率改善,而汇集全部六种语言时仅为 3.9% 的相对改善。我们得出结论:即使在高度资源匮乏的环境下,谨慎选择语言外数据对多语言训练也是值得的,且“数据越多越好”的普遍假设并非总是成立。

关键词

引用

@article{arxiv.2108.06164,
  title  = {Multilingual training set selection for ASR in under-resourced Malian languages},
  author = {Ewald van der Westhuizen and Trideba Padhi and Thomas Niesler},
  journal= {arXiv preprint arXiv:2108.06164},
  year   = {2021}
}

备注

12 pages, 4 figures, Accepted for presentation at SPECOM 2021