中文

MCR-Data2vec 2.0:通过模型级一致性正则化改进自监督语音预训练

音频与语音处理 2023-06-16 v1

摘要

自监督学习(SSL)在语音处理任务中已取得显著进展。然而,尽管 Transformer 结构存在固有的随机性(如 dropout 变体和 layer-drop),在语音 SSL 文献中改进模型级一致性仍鲜有探索。为此,我们提出一种新的预训练方法,利用一致性正则化来改进近期最先进的(SOTA)SSL 模型 Data2vec 2.0。具体而言,所提方法在 Data2vec 2.0 框架内采样两个不同的学生子模型,从而由单一输入产生两种输出变体而无需额外参数。随后,我们正则化学生子模型的输出使其一致,并要求它们预测教师模型的表示。实验结果表明,所提方法提升了 SSL 模型的鲁棒性与泛化能力,在 SUPERB 基准上取得了 SOTA 结果。

关键词

引用

@article{arxiv.2306.08463,
  title  = {MCR-Data2vec 2.0: Improving Self-supervised Speech Pre-training via Model-level Consistency Regularization},
  author = {Ji Won Yoon and Seok Min Kim and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2306.08463},
  year   = {2023}
}

备注

INTERSPEECH 2023