OkwuGbé:面向丰语和伊博语的端到端语音识别
计算与语言
2021-03-17 v2 人工智能
计算机与社会
摘要
语言是人类交流中固有且必需的。无论以书面还是口语形式表达,它都确保了同地区和不同地区人们之间的理解。随着将更多低资源语言纳入NLP研究的意识与努力不断增强,非洲语言近年来已成为机器翻译及NLP其他基于文本领域的主要研究对象。然而,针对非洲语言的语音识别研究仍十分匮乏。有趣的是,影响NLP的非洲语言某些独特属性(如变音符号与声调复杂性)主要根植于其语音,这表明细致的语音解读可为处理非洲语言在基于文本的NLP中的语言复杂性提供更多直觉。OkwuGbé是构建非洲低资源语言语音识别系统的一步。我们以丰语和伊博语为案例,对每种语言进行全面的语言学分析,并描述为这两种语言创建基于端到端深度神经网络的语音识别模型的过程。我们提出了丰语的SOTA ASR模型,以及伊博语的基准ASR模型结果。我们的语言学分析(针对丰语和伊博语)为其他非洲低资源语言语音识别模型的创建提供了宝贵见解与指导,并将指导丰语和伊博语未来的NLP研究。丰语和伊博语模型的源代码已公开可用。
引用
@article{arxiv.2103.07762,
title = {OkwuGb\'e: End-to-End Speech Recognition for Fon and Igbo},
author = {Bonaventure F. P. Dossou and Chris C. Emezue},
journal= {arXiv preprint arXiv:2103.07762},
year = {2021}
}