基于音素的子词单元用于端到端语音识别的研究
音频与语音处理
2021-06-23 v6
摘要
音素及其上下文相关变体一直是传统语音识别系统的标准建模单元,而字符和子词已在端到端识别系统中展现出有效性。我们研究了基于音素的子词(特别是字节对编码(byte pair encoder, BPE))作为端到端语音识别建模单元的使用。此外,我们还基于发音词典开发了基于多级语言模型的解码算法。除了使用易于获取的词典外,我们的系统避免了传统系统所需的额外专家知识或处理步骤。实验结果表明,基于音素的BPE往往比基于字符的对应方法产生更准确的识别系统。此外,通过一种新颖的单遍联合束搜索解码器可进一步改进,该解码器高效地结合了基于音素和基于字符的BPE系统。在Switchboard上,我们的基于音素的BPE系统在测试集的Switchboard/CallHome部分取得了6.8%/14.4%的词错误率(WER),而联合解码取得了6.3%/13.3%的WER。在Fisher + Switchboard上,联合解码达到了4.9%/9.5%的WER,为电话语音识别树立了新的里程碑。
引用
@article{arxiv.2004.04290,
title = {An investigation of phone-based subword units for end-to-end speech recognition},
author = {Weiran Wang and Guangsen Wang and Aadyot Bhatnagar and Yingbo Zhou and Caiming Xiong and Richard Socher},
journal= {arXiv preprint arXiv:2004.04290},
year = {2021}
}
备注
Interspeech 2020 final version. Implementation for reproducing the results can be found at: https://github.com/salesforce/transformerasr