中文

面向低资源语言中的方言包容识别:平衡语料库是答案吗?

计算与语言 2023-07-17 v1 声音 音频与语音处理

摘要

ASR 系统通常针对口语“标准语”构建,其对非标准方言/变体的识别性能会下降。对于像爱尔兰语这样没有单一口语标准、而是有三大主要方言——Ulster(Ul)、Connacht(Co)和 Munster(Mu)——的语言,这是一个问题。作为量化说话者方言对识别性能影响的诊断,我们训练了 12 个 ASR 系统,首先使用基线方言平衡训练语料库,然后使用基线的修改版本,其中方言特定材料被删减或增补。结果表明,方言平衡语料库并未在各方言上产生相似性能:Ul 方言始终表现较差,而 Mu 方言词错率最低。Co 与 Mu 方言之间存在紧密关系,但不对称。这些结果将指导未来的语料库收集与系统构建策略,以优化跨方言性能公平性。

关键词

引用

@article{arxiv.2307.07295,
  title  = {Towards dialect-inclusive recognition in a low-resource language: are balanced corpora the answer?},
  author = {Liam Lonergan and Mengjie Qian and Neasa Ní Chiaráin and Christer Gobl and Ailbhe Ní Chasaide},
  journal= {arXiv preprint arXiv:2307.07295},
  year   = {2023}
}

备注

Accepted to Interspeech 2023, Dublin