Whisper更强:增强Wav2Vec 2.0以实现低资源语言中的卓越自动语音识别
计算与语言
2025-01-03 v1 声音
音频与语音处理
摘要
由于验证数据集的稀缺性和方言的多样性,处理低资源语言中的语音转文本和自动语音识别问题极具挑战性。阿拉伯语、俄语和葡萄牙语就是这些困难的典型例子,由于这些语言在全球不同大洲存在多种方言,它们属于低资源语言。此外,这些语言的口音和发音多样性使得自动语音识别模型难以成功。随着深度学习和Transformer的日益普及,像著名的Wav2Vec2这样的声学模型在语音识别领域取得了优于现有方法的性能。然而,尽管Wav2Vec2比传统方法效率更高,但其在代表性不足的语言上的性能显著下降,尽管它需要的标注数据更少。本文介绍了一个端到端框架,通过数据增强技术增强基于Wav2Vec2微调的自动语音识别系统。为了验证我们框架的有效性,我们使用Mozilla Common Voice项目中阿拉伯语、俄语和葡萄牙语的三个数据集进行了详细的实验评估。此外,本文提出的框架对不同变音符号表现出鲁棒性。最终,我们的方法优于两个先前基线模型——预训练的Wav2Vec2和著名的Whisper自动语音识别模型,在词错误率上实现了平均33.9%的相对改进,在字符错误率上实现了53.2%的相对改进。
引用
@article{arxiv.2501.00425,
title = {Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages},
author = {Or Haim Anidjar and Revital Marbel and Roi Yozevitch},
journal= {arXiv preprint arXiv:2501.00425},
year = {2025}
}
备注
15 pagesm 3 figures