中文

使用荷兰档案数据进行语音表示自监督学习

声音 2025-07-09 v2 计算与语言 机器学习 音频与语音处理

摘要

本文探讨了使用荷兰档案电视广播数据进行语音基础模型(具体为 wav2vec 2.0)的自监督学习。我们首先研究预训练的数据质量假设,展示了音乐、噪声和说话人重叠如何影响 SSL 收敛和下游微调性能。其次,我们探索有效的预处理策略,将噪声广播数据集转换为用于预训练的质量数据集,方法是使用 Whisper 和 WhisperX。第三,我们比较了单语言和多语言预训练在等效数据量下的表现,表明单语言预训练对域外数据更具鲁棒性。最后,我们通过继续对 wav2vec 2.0 XLS-R 模型检查点进行预训练,以我们的 55k 小时档案数据集,实现了荷兰语的 SOTA wav2vec 2.0 模型。

关键词

引用

@article{arxiv.2507.04554,
  title  = {Self-supervised learning of speech representations with Dutch archival data},
  author = {Nik Vaessen and Roeland Ordelman and David A. van Leeuwen},
  journal= {arXiv preprint arXiv:2507.04554},
  year   = {2025}
}

备注

accepted at interspeech 2025