中文

基于最小增量语言模型的初始解码以提高低资源 ASR 中的 Lattice Rescoring

音频与语音处理 2024-03-19 v1 计算与语言 机器学习

摘要

本文解决的问题是如何在语言模型不足以生成包容性 lattice 的情况下提高低资源语言的语音识别准确率。我们通过引入 word unigram 计数(这些计数在目标语言的较大文本语料库中存在,但在基线中缺失)来最小化地增量化基线语言模型。使用此类增量化基线语言模型进行解码后生成的 lattice 更为全面。我们的方法在 Telugu(21.8%)和 Kannada(41.8%)上实现了相对词错误率 reductions。这种词错误率的降低,相当于使用完整维基百科文本增量化语言模型进行解码时在 Telugu(21.5%)和 Kannada(45.9%)上获得的相对词错误率 reductions,而本方法仅耗费内存的 1/8。我们展示了该方法在 various text selection-based language model augmentation 方法中具有相当效果,并且适用于不同数据集大小的数据集。该方法适用于在低资源条件下训练语音识别系统的场景,即语音数据和计算资源不足,而目标语言中可获得大型文本语料。我们的研究涉及解决基线词表外词的问题,一般而言,不专注于解决命名实体缺失的问题。我们的方法简单且计算开销较小。

关键词

引用

@article{arxiv.2403.10937,
  title  = {Initial Decoding with Minimally Augmented Language Model for Improved Lattice Rescoring in Low Resource ASR},
  author = {Savitha Murthy and Dinkar Sitaram},
  journal= {arXiv preprint arXiv:2403.10937},
  year   = {2024}
}

备注

14 pages, 7 figures, Accepted in Sadhana Journal