KinSPEAK:通过半监督学习方法改进卢旺达语语音识别
音频与语音处理
2024-03-05 v3 机器学习
声音
摘要
尽管近期已有大量转写的卢旺达语语音数据可用,但实现鲁棒的卢旺达语语音识别仍具挑战性。在这项工作中,我们表明使用自监督预训练、在微调期间遵循简单的课程表安排,以及利用半监督学习来挖掘大量无标签语音数据,可显著改善卢旺达语的语音识别性能。我们的方法仅聚焦于使用公共领域数据。我们从公共网站收集了一个新的录音室质量语音数据集,然后用于训练一个干净的基线模型。该干净基线模型随后用于对更丰富且含噪的公共数据集中的样本进行排序,从而定义一个简单的课程训练安排。最后,我们应用半监督学习在连续五代中标注并从大量无标签数据中学习。我们的最终模型在新数据集上实现了3.2%的词错误率(WER),在Mozilla Common Voice基准上实现了15.6%的WER,据我们所知这是当前最优性能。我们的实验还表明,使用基于音节而非基于字符的分词可为卢旺达语带来更好的语音识别性能。
引用
@article{arxiv.2308.11863,
title = {KinSPEAK: Improving speech recognition for Kinyarwanda via semi-supervised learning methods},
author = {Antoine Nzeyimana},
journal= {arXiv preprint arXiv:2308.11863},
year = {2024}
}
备注
9 pages, 2 figures, 5 tables