批大小对对比自监督语音表征学习的影响
声音
2024-02-22 v1 机器学习
音频与语音处理
摘要
语音基础模型通常使用多个 GPU 进行训练,这隐式地导致了较大的有效批大小。在本文中,我们研究了批大小对预训练的影响,包括训练期间可监测的统计量,以及对下游微调任务性能的影响。通过使用从 87.5 秒到 80 分钟语音不等的批大小,我们表明,在固定迭代次数下,较大的批大小能产生更好的预训练模型。然而,稳定性存在下限,有效性存在上限。我们进一步表明,预训练模型的质量主要取决于训练期间所见的语音数据量,即批大小与迭代次数的乘积。所有结果均通过 wav2vec 2.0 架构的独立实现得出,该实现在很大程度上复现了原工作(arXiv:2006.11477)的结果。我们的扩展研究可帮助研究者在研究语音自监督学习时选择有效的运行条件,并提示应以固定已见数据量对自监督方法进行基准测试。代码和模型检查点可在 https://github.com/nikvaessen/w2v2-batch-size 获取。
关键词
引用
@article{arxiv.2402.13723,
title = {The Effect of Batch Size on Contrastive Self-Supervised Speech Representation Learning},
author = {Nik Vaessen and David A. van Leeuwen},
journal= {arXiv preprint arXiv:2402.13723},
year = {2024}
}