使用荷兰档案数据进行语音表示自监督学习
声音
2025-07-09 v2 计算与语言
机器学习
音频与语音处理
摘要
本文探讨了使用荷兰档案电视广播数据进行语音基础模型(具体为 wav2vec 2.0)的自监督学习。我们首先研究预训练的数据质量假设,展示了音乐、噪声和说话人重叠如何影响 SSL 收敛和下游微调性能。其次,我们探索有效的预处理策略,将噪声广播数据集转换为用于预训练的质量数据集,方法是使用 Whisper 和 WhisperX。第三,我们比较了单语言和多语言预训练在等效数据量下的表现,表明单语言预训练对域外数据更具鲁棒性。最后,我们通过继续对 wav2vec 2.0 XLS-R 模型检查点进行预训练,以我们的 55k 小时档案数据集,实现了荷兰语的 SOTA wav2vec 2.0 模型。
关键词
引用
@article{arxiv.2507.04554,
title = {Self-supervised learning of speech representations with Dutch archival data},
author = {Nik Vaessen and Roeland Ordelman and David A. van Leeuwen},
journal= {arXiv preprint arXiv:2507.04554},
year = {2025}
}
备注
accepted at interspeech 2025