中文

CCC-wav2vec 2.0:聚类辅助的跨对比自监督语音表征学习

计算与语言 2023-05-16 v3

摘要

尽管自监督学习(Self-Supervised Learning)已帮助我们从可用的无标注数据中获取规模收益,其学习范式仍在持续改进。我们提出一种新的预训练策略,名为 ccc-wav2vec 2.0,它使用聚类与基于增强的跨对比损失作为其自监督目标。通过聚类模块,我们削弱了那些与正例高度相似的负例的影响。跨对比损失在原始样本的编码器输出与其增强的量化器输出之间,以及反之,进行计算,从而为预训练策略带来鲁棒性。ccc-wav2vec 2.0 在 LibriSpeech 的 test-clean 与 test-other 集上分别取得比基线 wav2vec 2.0 高 15.6% 与 12.7% 的相对 WER 提升,且未使用任何语言模型。所提方法在 Switchboard 数据上微调时,也取得比基线 wav2vec 2.0 高 14.9% 的相对 WER 提升。我们将所有代码公开于 GitHub。

关键词

引用

@article{arxiv.2210.02592,
  title  = {CCC-wav2vec 2.0: Clustering aided Cross Contrastive Self-supervised learning of speech representations},
  author = {Vasista Sai Lodagala and Sreyan Ghosh and S. Umesh},
  journal= {arXiv preprint arXiv:2210.02592},
  year   = {2023}
}

备注

Accepted to IEEE SLT 2022