中文

基于无监督词干提取的语言模型用于泰卢固语广播新闻转写

计算与语言 2019-08-13 v1 音频与语音处理

摘要

在印度语言中,母语使用者能够理解通过词根与时态和/或性别人称的组合或修改而形成的新词。由于数据不足,自动语音识别系统(ASR)可能无法在语言模型中容纳所有词汇,无论文本语料库规模大小。若因词根的形态变化导致数据量呈指数增长,计算上也会变得极具挑战。本文针对印度语言泰卢固语,基于印地语的无监督方法,提出了一种新方法以生成语言模型中的集外词(OOV)。通过利用平滑以及将预处理数据与有监督和无监督词干提取进行插值等技术,解决了印度语言泰卢固语语言模型中的不同问题。我们观察到,与有监督学习预处理数据上的其他技术相比,Witten-Bell 和 Kneser-Ney 平滑技术表现更佳。ASR 的准确率在有监督和无监督词干提取下分别提升了 0.76% 和 0.94%。

关键词

引用

@article{arxiv.1908.03734,
  title  = {Unsupervised Stemming based Language Model for Telugu Broadcast News Transcription},
  author = {Mythili Sharan Pala and Parayitam Laxminarayana and A. V. Ramana},
  journal= {arXiv preprint arXiv:1908.03734},
  year   = {2019}
}

备注

first draft