中文

面向马拉雅拉姆语开放词表语音识别的音节子词单元

计算与语言 2023-01-18 v1

摘要

在混合自动语音识别 (ASR) 系统中,发音词典 (PL) 和语言模型 (LM) 对于正确检索口语词汇序列至关重要。马拉雅拉姆语作为一种形态复杂的语言,其词汇量非常庞大,因此不可能构建一个涵盖所有不同词形的 PL 和 LM。使用子词单元构建 PL 和 LM,并在解码后将它们组合成词,能够恢复许多词表外词汇。在这项工作中,我们研究了在马拉雅拉姆语 ASR 中使用音节作为子词单元代替词的影响,并评估了在词典大小、模型内存需求和词错误率方面的相对改进。

关键词

引用

@article{arxiv.2301.06736,
  title  = {Syllable Subword Tokens for Open Vocabulary Speech Recognition in Malayalam},
  author = {Kavya Manohar and A. R. Jayan and Rajeev Rajan},
  journal= {arXiv preprint arXiv:2301.06736},
  year   = {2023}
}