将 wav2vec2 应用于孟加拉语 Common Voices 数据集的语音识别
音频与语音处理
2022-09-15 v1 人工智能
机器学习
摘要
语音本质上是连续的,其中离散的单词、音素和其他单元没有被清晰分割,因此语音识别数十年来一直是一个活跃的研究问题。在这项工作中,我们对 wav2vec 2.0 进行了微调以识别和转写孟加拉语语音——在孟加拉语 Common Voice 语音数据集上训练它。在由 36919 个 mp3 文件组成的训练集上训练 71 个 epoch 后,我们在大小为 7747 的验证集上取得了 0.3172 的训练损失和 0.2524 的 WER。使用 5-gram 语言模型,在大小为 7747 的测试集上 Levenshtein 距离为 2.6446。随后将训练集与验证集合并、打乱并按 85-15 比例划分。在该合并数据集上再训练 7 个 epoch,在测试集上得到了改进的 2.60753 的 Levenshtein 距离。我们的模型是表现最佳的,在隐藏数据集上取得了 6.234 的 Levenshtein 距离,比其他竞争提交低 1.1049 个单位。
引用
@article{arxiv.2209.06581,
title = {Applying wav2vec2 for Speech Recognition on Bengali Common Voices Dataset},
author = {H. A. Z. Sameen Shahgir and Khondker Salman Sayeed and Tanjeem Azwad Zaman},
journal= {arXiv preprint arXiv:2209.06581},
year = {2022}
}
备注
5 pages