中文

梵语自动语音识别:一个新的语音语料库与建模见解

音频与语音处理 2021-07-26 v2 计算与语言 机器学习 声音

摘要

由于梵语中存在的各种语言特殊性,梵语自动语音识别(ASR)颇具趣味。梵语在词汇上能产,在词边界处发生语音的语音同化,并表现出拼写惯例与发音上的变体。本工作中,我们提出首个梵语自动语音识别(ASR)的大规模研究,重点考察梵语 ASR 中单元选择的影响。我们发布了 78 小时的梵语 ASR 数据集,其忠实地捕捉了该语言所表现的若干语言特征。我们研究了不同声学模型与语言模型单元在梵语 ASR 系统中的作用。我们还受音节级单元选择的启发,提出了一种新的建模单元,其捕捉从词中一个元音到下一个元音的字符序列。我们也强调了为梵语选择字位表示的重要性,并展示了该选择对词错误率(WER)的影响。最后,我们将这些来自梵语 ASR 的见解扩展至构建古吉拉特语和泰卢固语两种其他印度语言的 ASR 系统。对这两种语言,我们的实验结果均表明,在 ASR 中使用基于语音的字位表示相较于使用原生文字的 ASR 系统带来了性能提升。

关键词

引用

@article{arxiv.2106.05852,
  title  = {Automatic Speech Recognition in Sanskrit: A New Speech Corpus and Modelling Insights},
  author = {Devaraja Adiga and Rishabh Kumar and Amrith Krishna and Preethi Jyothi and Ganesh Ramakrishnan and Pawan Goyal},
  journal= {arXiv preprint arXiv:2106.05852},
  year   = {2021}
}

备注

Accepted paper at the 59th Annual Meeting of the Association for Computational Linguistics (ACL 2021 Findings)