中文

面向ASR的掩码CPC与CTC联合训练

计算与语言 2021-02-16 v2 机器学习 声音

摘要

自监督学习(SSL)在习得对自动语音识别(ASR)有用的音频表示方面已展现出前景。但训练如wav2vec 2.0之类的SSL模型需要两阶段流水线。本文中我们展示了一种可利用无标签与有标签数据的ASR模型单阶段训练。训练期间,我们交替最小化两个损失:无监督掩码对比预测编码(CPC)损失与有监督音频到文本对齐损失连接主义时序分类(CTC)。我们表明,该联合训练方法利用无监督数据直接优化下游ASR任务性能,同时在Librispeech 100小时数据集上取得与wav2vec 2.0相近的词错误率。最后,我们假定求解对比任务是对有监督CTC损失的一种正则化。

关键词

引用

@article{arxiv.2011.00093,
  title  = {Joint Masked CPC and CTC Training for ASR},
  author = {Chaitanya Talnikar and Tatiana Likhomanenko and Ronan Collobert and Gabriel Synnaeve},
  journal= {arXiv preprint arXiv:2011.00093},
  year   = {2021}
}

备注

ICASSP 2021