中文

使用 S3PRL 工具包的语音数据增强方法比较

声音 2024-04-01 v2 人工智能 音频与语音处理

摘要

已知数据增强可改善语音处理任务的鲁棒性。在本研究中,我们总结并比较了使用 S3PRL 工具包的不同数据增强策略。我们探索了 HuBERT 和 wav2vec 在音素识别(PR)和自动语音识别(ASR)任务中使用不同增强技术(SpecAugment、高斯噪声、速度扰动)时的表现。我们根据音素错误率(PER)和词错误率(WER)评估模型性能。从实验中我们观察到,SpecAugment 略微提升了 HuBERT 和 wav2vec 在原始数据集上的性能。此外,我们表明使用高斯噪声和速度扰动数据集训练的模型在用增强测试集测试时更具鲁棒性。

关键词

引用

@article{arxiv.2303.00510,
  title  = {A Comparison of Speech Data Augmentation Methods Using S3PRL Toolkit},
  author = {Mina Huh and Ruchira Ray and Corey Karnei},
  journal= {arXiv preprint arXiv:2303.00510},
  year   = {2024}
}