基于Wav2vec2的自监督学习方法改进儿童语音识别的实验研究
音频与语音处理
2023-02-14 v3 声音
摘要
尽管深度学习技术近期取得进展,儿童语音识别仍是一项具有挑战性的任务。当前自动语音识别(ASR)模型需要大量标注数据用于训练,而此类数据稀缺。在本工作中,我们探索使用ASR模型wav2vec2,采用不同预训练与微调配置进行自监督学习(SSL),以改进自动儿童语音识别。预训练的wav2vec2模型使用不同数量的儿童语音训练数据、成人语音数据及两者组合进行微调,以发现针对儿童ASR任务微调模型所需的最优数据量。我们的训练模型在MyST儿童语音数据集上取得最佳词错误率(WER)7.42,在PFSTAR数据集上为2.99,在CMU KIDS数据集上为12.47,优于此前任何方法。我们的模型仅使用10小时儿童语音数据微调,便在儿童语音上超越了被视为成人语音上最先进ASR模型的wav2vec2 BASE 960。还通过在预训练、微调和推理中使用数据集组合,提供了对不同类型训练数据及其对推理影响的分析。
引用
@article{arxiv.2204.05419,
title = {A Wav2vec2-Based Experimental Study on Self-Supervised Learning Methods to Improve Child Speech Recognition},
author = {Rishabh Jain and Andrei Barcovschi and Mariam Yiwere and Dan Bigioi and Peter Corcoran and Horia Cucu},
journal= {arXiv preprint arXiv:2204.05419},
year = {2023}
}
备注
Preprint, Submitted to IEEE Access