中文

字节对编码在孟加拉语自动语音识别中的应用

计算与语言 2024-01-30 v1 声音 音频与语音处理

摘要

字节对编码(BPE)作为一种有效的分词方法,在解决各种自然语言和语音处理任务中的集外词(OOV)挑战方面脱颖而出。最近的研究强调了BPE子词分词的有效性对语言形态特性的依赖性,特别是在形态丰富的语言中,较少的BPE合并就足以生成高产的词元。受此启发,我们的研究通过实验确定了孟加拉语(一种以其形态复杂性著称的语言)的最佳BPE词元数量,从而提升了分布外自动语音识别(ASR)的性能。实验评估表明,过多的BPE词元可能导致过拟合,而大约500-1000个词元则能带来更优的OOV性能。此外,我们对BPE与基于字符和基于一元语法的分词方法进行了比较分析。通过将BPE分词引入孟加拉语ASR,我们在LB-ASRTD评估集上将词错误率(WER)从基于字符的基线系统的66.44%显著降低至63.80%,在SHRUTI评估集上从46.34%降低至42.80%,这两个数据集均包含分布外数据。

关键词

引用

@article{arxiv.2401.15532,
  title  = {Byte Pair Encoding Is All You Need For Automatic Bengali Speech Recognition},
  author = {Ahnaf Mozib Samin},
  journal= {arXiv preprint arXiv:2401.15532},
  year   = {2024}
}

备注

Under-review