中文

鲁棒wav2vec 2.0:自监督预训练中的域偏移分析

声音 2021-09-09 v2 计算与语言 机器学习 音频与语音处理

摘要

语音表征的自监督学习一直是非常活跃的研究领域,但多数工作聚焦于单一域,例如存在大量标注与未标注数据的有声读物朗读音频。本文中,我们探索更通用的设定,即用于预训练的未标注数据域不同于用于微调的标注数据域,而后者又可能不同于测试数据域。我们的实验表明,在预训练期间使用目标域数据可在多种设定下带来大幅性能提升。在一个大规模竞争性设定中,我们展示在域内未标注数据上预训练可将域内与域外标注数据训练的模型间差距缩小66%–73%。这显然具有实际意义,因为获取未标注目标域数据远比标注数据容易。此外,我们发现多域预训练提升了对训练期间未见过域的泛化性能。代码与模型将发布于 https://github.com/pytorch/fairseq。

关键词

引用

@article{arxiv.2104.01027,
  title  = {Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training},
  author = {Wei-Ning Hsu and Anuroop Sriram and Alexei Baevski and Tatiana Likhomanenko and Qiantong Xu and Vineel Pratap and Jacob Kahn and Ann Lee and Ronan Collobert and Gabriel Synnaeve and Michael Auli},
  journal= {arXiv preprint arXiv:2104.01027},
  year   = {2021}
}