中文

面向苏丹方言的端到端自动语音识别模型

计算与语言 2022-12-22 v1

摘要

设计自然语音接口主要依赖语音识别来实现人与现代数字生活设备之间的交互。此外,语音识别缩小了单语个体间更好交流沟通的差距。然而,该领域对若干通用语言及其方言缺乏广泛支持,而多数日常对话正是使用它们进行的。本文考察为苏丹方言(阿拉伯语方言之一,其复杂性源于使用者独特的历史与社会条件)设计自动语音识别模型的可行性。此状况反映于该方言的形式与内容之中,故本文概述苏丹方言,并执行收集代表性资源与预处理以构建适度数据集来克服标注数据匮乏的任务。同时提出端到端语音识别模型,其设计采用卷积神经网络构建。苏丹方言数据集将成为赋能未来针对该方言的自然语言处理研究的垫脚石。所设计模型对当前识别任务提供了若干见解,并达到平均标签错误率 73.67%。

关键词

引用

@article{arxiv.2212.10826,
  title  = {End-to-End Automatic Speech Recognition model for the Sudanese Dialect},
  author = {Ayman Mansour and Wafaa F. Mukhtar},
  journal= {arXiv preprint arXiv:2212.10826},
  year   = {2022}
}