基于Deep Speech的端到端印度英语口音自动语音识别(ASR)
计算与语言
2022-04-05 v1 声音
音频与语音处理
摘要
自动语音识别(ASR)是计算机科学与语言学的交叉应用,能够从说出的语音波形中得到转写文本。它在军事领域(如高性能战斗机、直升机、空中交通管制员)有多种应用。除军事外,语音识别还用于医疗、残障人士等诸多方面。ASR一直是一个活跃的研究领域。已有多种语音转文本(STT)的模型与算法被提出。其中较新的是Mozilla Deep Speech,它基于百度的Deep Speech研究论文。Deep Speech是一种最先进的语音识别系统,采用端到端深度学习开发,使用优化良好的递归神经网络(RNN)训练系统并利用多个图形处理单元(GPU)进行训练。该训练大多使用美式英语口音数据集,导致对其他英语口音的泛化能力较差。印度地域多样性极强,这在语音中亦有体现,各邦的英语口音差异显著。本工作中,我们采用迁移学习方法,使用最新的Deep Speech模型(即deepspeech-0.9.3)开发面向印度英语口音的端到端语音识别系统。本工作利用微调与数据增广进一步优化和改进Deep Speech ASR系统。印度英语口音的Indic TTS数据被用于迁移学习与预训练Deep Speech模型的微调。我们对未训练模型、我们所训练模型以及其他可用的印度英语口音语音识别服务进行了总体比较。
引用
@article{arxiv.2204.00977,
title = {Deep Speech Based End-to-End Automated Speech Recognition (ASR) for Indian-English Accents},
author = {Priyank Dubey and Bilal Shah},
journal= {arXiv preprint arXiv:2204.00977},
year = {2022}
}