中文

基于随机投影量化器的自监督学习用于语音识别

计算与语言 2022-07-01 v2 声音 音频与语音处理

摘要

我们提出了一种简单而有效的自监督语音识别学习方法。该方法学习一个模型来预测被掩蔽的语音信号,其形式为用随机投影量化器生成的离散标签。具体而言,量化器使用随机初始化的矩阵投影语音输入,并在随机初始化的码本中进行最近邻查找。在自监督学习过程中,矩阵与码本均不更新。由于随机投影量化器未经训练且与语音识别模型分离,该设计使方法具有灵活性,并兼容通用语音识别架构。在 LibriSpeech 上,我们的方法使用非流式模型取得了与先前自监督学习工作相近的词错误率,并在使用流式模型时提供了比 wav2vec 2.0 和 w2v-BERT 更低的词错误率与延迟。在多语言任务上,该方法相较 wav2vec 2.0 和 w2v-BERT 也带来了显著提升。

关键词

引用

@article{arxiv.2202.01855,
  title  = {Self-supervised Learning with Random-projection Quantizer for Speech Recognition},
  author = {Chung-Cheng Chiu and James Qin and Yu Zhang and Jiahui Yu and Yonghui Wu},
  journal= {arXiv preprint arXiv:2202.01855},
  year   = {2022}
}

备注

ICML 2022