一种用于精确多方言语音识别的高自适应声学模型
机器学习
2022-05-09 v1
摘要
尽管深度学习在语音识别中取得了成功,多方言语音识别仍是一个难题。尽管特定方言的声学模型通常表现良好,但当特定方言数据稀缺且每种语言的方言数量众多时,它们不易维护。因此,迫切需要一种能很好地泛化到多种方言的统一声学模型(AM)。本文提出一种新颖的声学建模技术,使用单一 AM 实现精确的多方言语音识别。我们提出的 AM 基于方言信息及其内部表示进行动态适配,从而形成一个可同时处理多种方言的高自适应 AM。我们还提出一种简单而有效的训练方法来应对未见方言。在大规模语音数据集上的实验结果表明,所提出的 AM 优于以往所有模型,相较于单一全方言 AM 词错误率(WER)相对降低 8.11%,相较于特定方言 AM 相对降低 7.31%。
引用
@article{arxiv.2205.03027,
title = {A Highly Adaptive Acoustic Model for Accurate Multi-Dialect Speech Recognition},
author = {Sanghyun Yoo and Inchul Song and Yoshua Bengio},
journal= {arXiv preprint arXiv:2205.03027},
year = {2022}
}