中文

面向自监督语音表征领域自适应微调的自动数据增强

音频与语音处理 2023-06-02 v1 机器学习

摘要

自监督学习(SSL)得以利用大量无标注语音数据,即便在小型标注数据集下也能提升语音识别模型性能。尽管如此,当预训练与目标数据集间存在声学失配时,语音 SSL 表征可能失效。为解决此问题,我们提出一种新颖的监督式领域自适应方法,针对声学领域呈现此类失配的情形而设计。其包括对大型干净数据集施加恰当标定的数据增强,使其更接近目标领域,并用作初始微调阶段的一部分。增强通过对基于目标数据集的条件依赖估计器的最小化自动选取。该方法在受控失真下的预言机实验及两个业余采集的低资源领域上均得到验证,两种情况下均达到优于基线的性能。

关键词

引用

@article{arxiv.2306.00481,
  title  = {Automatic Data Augmentation for Domain Adapted Fine-Tuning of Self-Supervised Speech Representations},
  author = {Salah Zaiem and Titouan Parcollet and Slim Essid},
  journal= {arXiv preprint arXiv:2306.00481},
  year   = {2023}
}

备注

6 pages,INTERSPEECH 2023