自监督、弱监督与全监督训练方法在多领域自动语音识别上的研究:以孟加拉国孟加拉语为例
计算与语言
2023-05-12 v3 声音
音频与语音处理
摘要
尽管采用神经网络的自动语音识别(ASR)取得了巨大改进,但由于领域偏移,ASR系统仍面临缺乏鲁棒性和泛化性问题。这主要是因为编译ASR数据集时往往未充分识别和考察主要语料库设计标准。在本研究中,我们考察了最先进的迁移学习方法(如自监督wav2vec 2.0和弱监督Whisper)以及全监督卷积神经网络(CNN)在多领域ASR上的鲁棒性。我们还通过在全新的多领域孟加拉国孟加拉语ASR评测基准BanSpeech上评估这些模型,展示了构建语料库时领域选择的重要性;BanSpeech包含约6.52小时人工标注语音和来自13个不同领域的8085条语句。形态丰富的孟加拉语以朗读型语音为主的语料库SUBAK.KO已被用于训练ASR系统。实验评估显示,相比弱监督和全监督,自监督跨语言预训练是应对多领域ASR任务的最佳策略。此外,在SUBAK.KO上训练的ASR模型难以识别以自发语音为主的领域语音。BanSpeech将公开以满足孟加拉语ASR具有挑战性评测基准的需求。
引用
@article{arxiv.2210.12921,
title = {Investigating self-supervised, weakly supervised and fully supervised training approaches for multi-domain automatic speech recognition: a study on Bangladeshi Bangla},
author = {Ahnaf Mozib Samin and M. Humayon Kobir and Md. Mushtaq Shahriyar Rafee and M. Firoz Ahmed and Mehedi Hasan and Partha Ghosh and Shafkat Kibria and M. Shahidur Rahman},
journal= {arXiv preprint arXiv:2210.12921},
year = {2023}
}