自监督预训练在语音识别中的有效性
计算与语言
2020-05-20 v3 机器学习
摘要
我们比较了显式量化音频数据或在不量化情况下学习表示的两种自监督表示学习算法。我们发现前者更准确,因为它通过 vq-wav2vec [1] 建立了良好的数据词表,从而能够在后续 BERT 训练中习得有效表示。与先前工作不同,我们使用连接时序分类(Connectionist Temporal Classification, CTC)损失直接在转写语音上微调预训练的 BERT 模型,而非将表示输入任务特定模型。我们还提出了一种直接从连续音频数据学习的 BERT 风格模型,并比较了在原始音频与谱特征上的预训练。在 10 小时标注的 Librispeech 数据上用 vq-wav2vec 词表微调 BERT 模型,在 test-clean 上几乎与已知在 100 小时标注数据上训练的最佳系统一样好,同时在 test-other 上实现了 25% 的 WER 降低。当仅使用 10 分钟标注数据时,test-other 上 WER 为 25.2,test-clean 上为 16.3。这表明自监督能够使基于近乎零转写数据训练的语音识别系统成为可能。
引用
@article{arxiv.1911.03912,
title = {Effectiveness of self-supervised pre-training for speech recognition},
author = {Alexei Baevski and Michael Auli and Abdelrahman Mohamed},
journal= {arXiv preprint arXiv:1911.03912},
year = {2020}
}