LSTM 声学模型学会以字素进行对齐与发音
音频与语音处理
2020-08-17 v1 机器学习
摘要
自动语音识别对世界语言的覆盖持续扩大。然而,标准的基于音素的系统需要难以获取且成本高昂的手动构建词典。为解决此问题,我们提出了一种基于字素的语音识别器的训练方法,其可以以纯数据驱动方式训练。所研究的字素输出声学模型由 LSTM 网络构建并采用交叉熵损失训练,它们对现实应用也极为实用,因为可使用常规 ASR 技术栈组件(如语言模型与 FST 解码器)进行解码,并产生高质量的音频到字素对齐,这在许多语音应用中很有用。我们表明,在大型数据集上训练时,字素模型在词错率(WER)上与其音素输出对应模型具有竞争力,且优势在于字素模型不需要显式语言知识作为输入。我们进一步比较了音素与字素模型生成的对齐,以展示它们所学习发音的质量,使用了四种口语与书写形式在语言学上各异的印度语言。
引用
@article{arxiv.2008.06121,
title = {LSTM Acoustic Models Learn to Align and Pronounce with Graphemes},
author = {Arindrima Datta and Guanlong Zhao and Bhuvana Ramabhadran and Eugene Weinstein},
journal= {arXiv preprint arXiv:2008.06121},
year = {2020}
}
备注
5 pages, 4 figures. This work was done between summer 2018 and spring 2019