中文

用于 Transformer 编码器语音表征自监督学习的 Dropout 正则化

音频与语音处理 2021-07-12 v1 声音

摘要

预测被改变的声学帧是语音表征自监督学习的有效方式。然而,防止预训练模型过拟合具有挑战性。本文提出将两种 dropout 正则化方法引入 transformer 编码器的预训练:(1) 注意力 dropout,(2) 层 dropout。这两种 dropout 方法均促使模型利用全局语音信息,并在重构被掩码帧时避免仅复制局部频谱特征。我们在音素分类与说话人识别任务上评估了所提方法。实验表明,我们的 dropout 方法取得了具有竞争力的结果,并提升了下游任务的分类准确率。

关键词

引用

@article{arxiv.2107.04227,
  title  = {Dropout Regularization for Self-Supervised Learning of Transformer Encoder Speech Representation},
  author = {Jian Luo and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2107.04227},
  year   = {2021}
}

备注

will be presented in INTERSPEECH 2021