中文

W2v-BERT:结合对比学习与掩码语言建模的自监督语音预训练

机器学习 2021-09-15 v2 声音 音频与语音处理

摘要

受掩码语言建模~(MLM) 在预训练自然语言处理模型方面成功的启发,我们提出 w2v-BERT,其探索 MLM 用于自监督语音表征学习。w2v-BERT 是一个结合对比学习与 MLM 的框架,前者训练模型将输入的连续语音信号离散化为一组有限的判别性语音令牌,后者训练模型通过求解消费离散化令牌的掩码预测任务来学习上下文语音表征。与现有的基于 MLM 的语音预训练框架(如依赖迭代重聚类与重训练过程的 HuBERT,或拼接两个分别训练模块的 vq-wav2vec)不同,w2v-BERT 可通过同时求解两个自监督任务~(对比任务与 MLM)以端到端方式优化。我们的实验表明,在使用 Libri-Light~60k 语料作为无监督数据时,w2v-BERT 在 LibriSpeech 基准上相较当前最先进的预训练模型取得了有竞争力的结果。特别地,与已发布的模型如基于 conformer 的 wav2vec~2.0 和 HuBERT 相比,我们的模型在 test-clean 与 test-other 子集上展现出约 5\% 至~10\% 的相对 WER 降低。当应用于 Google 的 Voice Search 流量数据集时,w2v-BERT 相对我们内部的基于 conformer 的 wav2vec~2.0 高出逾~30\% 的性能。

关键词

引用

@article{arxiv.2108.06209,
  title  = {W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training},
  author = {Yu-An Chung and Yu Zhang and Wei Han and Chung-Cheng Chiu and James Qin and Ruoming Pang and Yonghui Wu},
  journal= {arXiv preprint arXiv:2108.06209},
  year   = {2021}
}