带口音语音识别:基准测试、预训练与多样化数据
音频与语音处理
2022-05-18 v1 声音
摘要
构建包容性语音识别系统是迈向开发所有语言变体使用者均可使用的技术的重要一步。因此,ASR 系统必须不受说话方式影响地为所有人服务。为实现这一目标,既需要代表语言变体的可用数据集,也需要理解哪种模型配置最有助于实现对所有类型语音的稳健理解。然而,目前缺乏足够的带口音语音数据集,且对于已有的数据集,需要探索更多训练方法以提升带口音语音识别的质量。在本文中,我们探讨了开发更具包容性 ASR 系统的最新进展,即构建代表语言多样性的新数据集的重要性,以及探索提升所有用户性能的新颖训练方法。我们探讨了带口音语音 ASR 系统基准测试的最新方向,测量了 wav2vec 2.0 预训练对带口音语音识别的影响,并重点介绍了与多样化 ASR 评估相关的语料库。
引用
@article{arxiv.2205.08014,
title = {Accented Speech Recognition: Benchmarking, Pre-training, and Diverse Data},
author = {Alëna Aksënova and Zhehuai Chen and Chung-Cheng Chiu and Daan van Esch and Pavel Golik and Wei Han and Levi King and Bhuvana Ramabhadran and Andrew Rosenberg and Suzan Schwartz and Gary Wang},
journal= {arXiv preprint arXiv:2205.08014},
year = {2022}
}
备注
5 pages, 3 tables