面向小学数学课堂环境自动语音识别中 Wav2vec2.0 领域自适应的持续预训练
计算与语言
2024-05-24 v1 人工智能
音频与语音处理
摘要
构建对课堂条件具有鲁棒性和适应性的自动语音识别(ASR)系统,对于开发辅助师生的 AI 工具至关重要。在本研究中,我们探讨了持续预训练(CPT)在将 Wav2vec2.0 适应至课堂领域中的有效性。我们表明,CPT 在该方面是一种强有力的工具,能够将基于 Wav2vec2.0 的模型的词错误率(WER)降低 10% 以上。更具体地说,CPT 提升了模型对不同噪声、麦克风、课堂条件以及课堂人口统计特征的鲁棒性。我们的 CPT 模型展现出了更强的泛化能力,能够适应标注微调数据中未见过的人口统计特征。
引用
@article{arxiv.2405.13018,
title = {Continued Pretraining for Domain Adaptation of Wav2vec2.0 in Automatic Speech Recognition for Elementary Math Classroom Settings},
author = {Ahmed Adel Attia and Dorottya Demszky and Tolulope Ogunremi and Jing Liu and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2405.13018},
year = {2024}
}