端到端孟加拉语语音识别
音频与语音处理
2020-11-12 v2 声音
摘要
孟加拉语是印度次大陆的一种重要语言。然而,尽管该地区所使用的重要语言已有许多最先进的声学模型,针对孟加拉语的研究与资源却寥寥无几。在本工作中,我们将基于 CTC 的 CNN-RNN 网络(一种突出的基于深度学习的端到端自动语音识别技术)应用于孟加拉语 ASR 任务。我们还提出并评估了小型 7x3 与 3x3 卷积核的适用性与有效性,这些卷积核主要因其 FLOPs 与参数高效特性而突出用于计算机视觉领域。我们提出了两个 CNN 模块:2 层 A 块与 4 层 B 块,其首层由 7x3 核构成,后续层仅由 3x3 核构成。利用公开可用的大型孟加拉语 ASR 训练数据集,我们对七种不同复杂度与深度的深度神经网络配置在孟加拉语 ASR 任务上的表现进行了基准测试与评估。我们的最佳模型(采用 B 块)的 WER 为 13.67,相较采用 41x11 与 21x11 较大卷积核的可比模型绝对降低了 1.39%。
引用
@article{arxiv.2009.09615,
title = {End-to-End Bengali Speech Recognition},
author = {Sayan Mandal and Sarthak Yadav and Atul Rai},
journal= {arXiv preprint arXiv:2009.09615},
year = {2020}
}
备注
4 pages, 2 figures, 3 tables