中文

基于弗拉芒荷兰语的自监督语音预训练方法比较

音频与语音处理 2025-02-06 v1 声音

摘要

近期语音处理的研究对从无标签数据中进行无监督和自监督表示学习表现出越来越浓厚的兴趣,以减轻对大量标注数据的需求。我们研究了几种流行的预训练方法,并将其应用于弗拉芒荷兰语。我们将现成的英语预训练模型与在不断增加的弗拉芒数据上训练的模型进行了比较。我们发现,向下游语音识别任务正向迁移的最重要因素包括大量的数据以及匹配的预训练域。理想情况下,我们还在目标语言的标注子集上进行微调。所有预训练模型都提高了弗拉芒语中的线性音素可分性,但并非所有方法都能改进自动语音识别。我们使用 wav2vec 2.0 获得了卓越的性能,并且在集成到 HMM-DNN 声学模型后,通过在弗拉芒荷兰语上微调多语言预训练的 XLSR-53 模型,我们获得了 30% 的 WER 提升。

关键词

引用

@article{arxiv.2109.14357,
  title  = {Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch},
  author = {Jakob Poncelet and Hugo Van hamme},
  journal= {arXiv preprint arXiv:2109.14357},
  year   = {2025}
}

备注

To be published in the 2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2021)