AccentDB:用于辅助神经语音识别的非母语英语口音数据库
音频与语音处理
2020-05-19 v1 计算与语言
声音
摘要
现代自动语音识别(ASR)技术已经发展到能够很好地识别母语者的语音。然而,对非母语者语音的识别仍然是一个主要挑战。在这项工作中,我们首先阐明了创建用于训练和测试稳健 ASR 系统的非母语口音语音样本精心整理数据库的关键要求。然后我们介绍了 AccentDB,这样一个包含我们收集的 4 种印度英语口音样本,以及 4 种母语英语口音和一种大都市印度英语口音样本汇编的数据库。我们还展示了所收集口音数据的可分离性分析。此外,我们提出了几种口音分类模型,并针对人工标注的口音类别进行了充分评估。我们在可见和不可见数据的多种设置下测试了分类器模型的泛化能力。最后,我们引入了使用具有特定任务架构的自编码器模型将非母语口音中性化为母语口音的任务。因此,我们的工作旨在通过在训练用的数据库、用于特征增强的分类模型以及用于非母语英语口音声学变换的中性化系统,在开发的每个阶段辅助 ASR 系统。
引用
@article{arxiv.2005.07973,
title = {AccentDB: A Database of Non-Native English Accents to Assist Neural Speech Recognition},
author = {Afroz Ahamad and Ankit Anand and Pranesh Bhargava},
journal= {arXiv preprint arXiv:2005.07973},
year = {2020}
}
备注
Proceedings of the 12th Language Resources and Evaluation Conference - LREC, 2020