鲁棒 Data2vec:结合回归与改进对比学习的噪声鲁棒语音表征学习用于 ASR
音频与语音处理
2022-10-28 v1 声音
摘要
基于对比学习或回归任务的自监督预训练方法可以利用更多无标签数据来提高自动语音识别(ASR)的性能。然而,结合这两种预训练任务以及为对比学习构建不同负样本对鲁棒性的影响仍不清楚。在本文中,我们提出了一种噪声鲁棒的 data2vec 用于自监督语音表征学习,通过在预训练阶段联合优化对比学习和回归任务。此外,我们提出了两种改进方法来促进对比学习。更具体地说,我们首先提出构建基于块的、非语义的负样本,以增强预训练模型的噪声鲁棒性,这是通过将特征分割成不同大小的块(即所谓的负样本)来实现的。其次,通过分析正负样本的分布,我们提出移除容易区分的负样本,以提高预训练模型的判别能力。在 CHiME-4 数据集上的实验结果表明,我们的方法能够提高预训练模型在噪声场景下的性能。我们发现,与仅训练回归任务相比,对比学习和回归任务的联合训练可以在一定程度上避免模型坍塌。
引用
@article{arxiv.2210.15324,
title = {Robust Data2vec: Noise-robust Speech Representation Learning for ASR by Combining Regression and Improved Contrastive Learning},
author = {Qiu-Shi Zhu and Long Zhou and Jie Zhang and Shu-Jie Liu and Yu-Chen Hu and Li-Rong Dai},
journal= {arXiv preprint arXiv:2210.15324},
year = {2022}
}
备注
Submitted to ICASSP 2023