大规模下的 UniSpeech:大规模语音识别数据集上预训练方法的实证研究
音频与语音处理
2021-07-13 v1
摘要
近来,自监督学习(SSL)受到极大关注,其中模型在大规模无标签数据上预训练,然后在小规模有标签数据集上微调。普遍观点认为 SSL 有助于仅有有限有标签数据可用的资源受限任务。当labeled训练数据量增大时,SSL 的益处持续减弱。据我们所知,SSL 的研究中至多使用了几千小时的有标签数据。相比之下,工业界通常使用数万小时的有标签数据来为资源丰富的语言构建高准确率语音识别(ASR)系统。在本研究中,我们挑战性地探究 SSL 能否以及如何改进基于 6.5 万小时匿名有标签 EN-US 数据构建的、最先进的产业级 Transformer-Transducer 模型的 ASR 准确率。
引用
@article{arxiv.2107.05233,
title = {UniSpeech at scale: An Empirical Study of Pre-training Method on Large-Scale Speech Recognition Dataset},
author = {Chengyi Wang and Yu Wu and Shujie Liu and Jinyu Li and Yao Qian and Kenichi Kumatani and Furu Wei},
journal= {arXiv preprint arXiv:2107.05233},
year = {2021}
}