中文

BigSSL:探索大规模半监督学习在自动语音识别中的前沿

音频与语音处理 2022-07-25 v3 计算与语言 机器学习 声音

摘要

我们总结了一系列使用巨型自动语音识别(ASR)模型的工作结果,这些模型使用包含约一百万小时音频的庞大且多样化的无标签数据集进行预训练。我们发现,预训练、自训练与扩大模型规模的组合极大地提高了数据效率,即使对于拥有数万小时标注数据的极大型任务也是如此。特别是在一个拥有34k小时标注数据的ASR任务上,通过微调一个80亿参数的预训练Conformer模型,我们仅用3%的训练数据即可匹配最先进水平(SoTA),并在使用完整训练集时显著改进SoTA。我们还报告了使用大型预训练与自训练模型为一大批下游任务带来的普遍收益,这些任务覆盖广泛的语音领域且数据集规模跨越多个数量级,包括在多个公开基准上取得SoTA性能。此外,我们利用预训练网络学到的表示在非ASR任务上取得了SoTA结果。

关键词

引用

@article{arxiv.2109.13226,
  title  = {BigSSL: Exploring the Frontier of Large-Scale Semi-Supervised Learning for Automatic Speech Recognition},
  author = {Yu Zhang and Daniel S. Park and Wei Han and James Qin and Anmol Gulati and Joel Shor and Aren Jansen and Yuanzhong Xu and Yanping Huang and Shibo Wang and Zongwei Zhou and Bo Li and Min Ma and William Chan and Jiahui Yu and Yongqiang Wang and Liangliang Cao and Khe Chai Sim and Bhuvana Ramabhadran and Tara N. Sainath and Françoise Beaufays and Zhifeng Chen and Quoc V. Le and Chung-Cheng Chiu and Ruoming Pang and Yonghui Wu},
  journal= {arXiv preprint arXiv:2109.13226},
  year   = {2022}
}

备注

14 pages, 7 figures, 13 tables; v2: minor corrections, reference baselines and bibliography updated; v3: corrections based on reviewer feedback, bibliography updated