基于联合CTC-Transformer的掩码预训练编码器
音频与语音处理
2020-08-14 v2
摘要
本研究(工作于腾讯AI Lab实习期间完成)关注半监督声学建模,即从无监督音频数据中获取高级表示,并利用有监督数据微调预训练模型参数。所提方法采用两阶段训练框架,由掩码预训练编码器(MPE)与联合CTC-Transformer(JCT)组成。在MPE框架中,部分输入帧被掩码,并在编码器后利用大量无监督数据重建。在JCT框架中,相较于原始Transformer,声学特征作为而非纯文本的输入。CTC损失作为编码器顶部的预测目标,解码器模块保持不变。本文给出了两阶段训练方法与全监督JCT的对比。此外,本文探究了所提方法针对不同训练数据量的鲁棒性。两阶段训练方法的实验性能远优于全监督模型。仅使用30% WSJ标注数据、采用两阶段训练的詞错误率(WER)相比以全监督方式用50% WSJ训练的模型降低了17%。而且,将MPE的无标注数据从WSJ(81h)增至Librispeech(960h)带来了约22%的WER降低。
引用
@article{arxiv.2005.11978,
title = {Masked Pre-trained Encoder base on Joint CTC-Transformer},
author = {Lu Liu and Yiheng Huang},
journal= {arXiv preprint arXiv:2005.11978},
year = {2020}
}