低资源语言ASR模型的适应性:Whisper与Wav2Vec-BERT在孟加拉语上的比较研究
计算与语言
2025-07-03 v1 人工智能
声音
音频与语音处理
摘要
近年来,基于大规模多语言文本和语音数据集训练的神经模型在支持低资源语言方面显示出巨大的潜力。本研究 investigates 两种最先进的自动语音识别(ASR)模型,OpenAI的Whisper(Small & Large-V2)和Facebook的Wav2Vec-BERT,在孟加拉语(Bangla)这种低资源语言上的性能。我们使用两个公开数据集:Mozilla Common Voice-17和OpenSLR进行实验,以评估模型性能。通过系统性的微调和超参数优化,包括学习率、训练轮数和模型检查点选择,我们根据词错误率(WER)、字符错误率(CER)、训练时间和计算效率对模型进行比较。实验结果表明,Wav2Vec-BERT在所有关键评估指标上超越了Whisper,同时要求更少的计算资源,为开发面向低资源语言环境中稳健语音识别系统提供了宝贵的见解。
关键词
引用
@article{arxiv.2507.01931,
title = {Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla},
author = {Md Sazzadul Islam Ridoy and Sumi Akter and Md. Aminur Rahman},
journal= {arXiv preprint arXiv:2507.01931},
year = {2025}
}