MS-HuBERT:缓解掩码语言建模方法中预训练与推理不匹配以学习语音表示
计算与语言
2025-02-19 v4
摘要
近年来,自监督预训练方法在学习原始语音中的高级信息方面获得了显著关注。在这些方法中,HuBERT在自动语音识别中展示了最先进的性能。然而,由于预训练策略的差异,HuBERT的性能落后于data2vec。在本文中,我们提出了(i)一种交换方法来解决HuBERT中观察到的预训练与推理不匹配问题,以及(ii)引入多簇掩码预测损失以更有效地利用模型容量。由此产生的方法MS-HuBERT是一种端到端的自监督预训练方法,用于学习鲁棒的语音表示。在不同的微调划分上评估时,它在ASR Librispeech基准测试上平均比原始HuBERT高出5%的边际。此外,我们证明了预训练期间学习到的嵌入编码了提高基于内容的任务(如ASR)性能所需的基本信息。
引用
@article{arxiv.2406.05661,
title = {MS-HuBERT: Mitigating Pre-training and Inference Mismatch in Masked Language Modelling methods for learning Speech Representations},
author = {Hemant Yadav and Sunayana Sitaram and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2406.05661},
year = {2025}
}
备注
4 pages, submitted to interspeech2024