中文

Jira: 一个库尔德语语音识别系统的设计与语音语料库及发音词典构建

人工智能 2021-02-16 v1

摘要

本文介绍了首个面向中库尔德语的大词汇量语音识别系统 (LVSR), 名为 Jira。库尔德语是一种印欧语系语言, 在多个国家有超过三千万使用者, 但由于缺乏语音与文本资源, 目前尚无该语言的语音识别系统。为填补此空白, 我们推出了首个库尔德语语音语料库与发音词典。在语音语料库方面, 我们设计了一个句子集, 其中双音素在集合中的比例近似于中库尔德语的真实数据。所设计的句子由 576 名说话人在无噪声麦克风控制的安静环境 (称为 AsoSoft Speech-Office) 中以及 Telegram 社交网络环境下使用手机 (记为 AsoSoft Speech-Crowdsourcing) 读出, 共得到 43.68 小时语音。此外, 我们设计了一个包含 11 个不同文档主题的测试集, 并在上述两种对应的语音条件下 (即 Office 与 Crowdsourcing) 录制。进而, 本研究制备了 60K 的发音词典, 其中我们面临若干挑战并提出了相应解决方案。库尔德语有多种方言与次方言, 导致大量词汇变体。我们详细给出了词汇变体的书写标准化及词典词元的自动发音方法。为搭建识别引擎, 我们使用了 Kaldi 工具包。系统中采用了从 AsoSoft 文本语料库提取的统计三元语言模型。我们使用了若干标准方法, 包括基于 HMM 的模型 (即 mono、tri1、tr2、tri2、tri3)、SGMM 与 DNN 方法来生成声学模型。这些方法分别以 AsoSoft Speech-Office、AsoSoft Speech-Crowdsourcing 及二者组合进行训练。最佳性能由 SGMM 声学模型取得, 其平均词错率 (在不同文档主题上) 为 13.9%, 通用主题上为 4.9%。

关键词

引用

@article{arxiv.2102.07412,
  title  = {Jira: a Kurdish Speech Recognition System Designing and Building Speech Corpus and Pronunciation Lexicon},
  author = {Hadi Veisi and Hawre Hosseini and Mohammad Mohammadamini and Wirya Fathy and Aso Mahmudi},
  journal= {arXiv preprint arXiv:2102.07412},
  year   = {2021}
}