用于泰米尔语和卡纳达语自动语音识别的知识驱动子词语法建模
音频与语音处理
2022-07-28 v1 声音
摘要
在本文中,我们提出了专为高度黏着和屈折的泰米尔语和卡纳达语设计的自动语音识别(ASR)系统,其可识别无限词汇量的词。我们使用子词作为识别的基本词法单元,并构建子词语法加权有限状态转换器(SG-WFST)图用于词分割,该图捕获了这些语言大部分复杂的构词规则。我们确定了以下类别的词:(i)动词、(ii)名词、(iii)代词和(iv)数词。为每一类创建了子词的前缀、中缀和后缀列表,并用于设计 SG-WFST 图。我们还提出了一种启发式分割算法,其甚至能分割不遵循 SG-WFST 图所封装规则的例外词。大多数数据驱动的子词词典创建算法是计算驱动的,因此不保证类语素单元,所以我们利用了语言的语言学知识并手动创建了子词词典和图。最后,我们训练了一个深度神经网络声学模型,并将其与子词词典的发音词典和 SG-WFST 图结合以构建子词 ASR 系统。由于子词 ASR 对给定测试语音输出子词序列,我们对其输出进行后处理以得到最终词序列,从而使得实际可识别的词数大大增加。在使用 IISc-MILE 泰米尔语和卡纳达语 ASR 语料库实验子词 ASR 系统后,我们观察到相对于基线基于词的 ASR 系统,泰米尔语和卡纳达语分别实现了绝对词错误率降低 12.39% 和 13.56%。
引用
@article{arxiv.2207.13333,
title = {Knowledge-driven Subword Grammar Modeling for Automatic Speech Recognition in Tamil and Kannada},
author = {Madhavaraj A and Bharathi Pilar and Ramakrishnan A G},
journal= {arXiv preprint arXiv:2207.13333},
year = {2022}
}