DeCoAR 2.0:带矢量量化的深度上下文声学表示
音频与语音处理
2020-12-15 v1 计算与语言
机器学习
摘要
近期语音表示学习的成功为利用无标签数据训练语音识别模型提供了新途径。在语音表示学习中,大量无标签数据以自监督方式用于学习特征表示,随后使用较少量的有标签数据基于新特征表示训练下游ASR系统。基于我们此前的工作DeCoAR并借鉴其他语音表示学习,我们提出DeCoAR 2.0,一种带矢量量化的深度上下文声学表示(Deep Contextualized Acoustic Representation)。我们相较DeCoAR做了若干改进:首先,编码模块使用Transformer而非LSTM;其次,在编码器与重构模块间引入矢量量化层;第三,我们提出将重构损失与矢量量化多样性损失相结合的损失目标来训练语音表示。实验表明,在不同数据稀疏场景下,该方法相较其他语音表示均有稳定提升。无需微调,仅用10小时LibriSpeech有标签数据并以DeCoAR 2.0特征训练的轻量级ASR模型,优于使用全量960小时数据集及滤波器组特征训练的模型。
引用
@article{arxiv.2012.06659,
title = {DeCoAR 2.0: Deep Contextualized Acoustic Representations with Vector Quantization},
author = {Shaoshi Ling and Yuzong Liu},
journal= {arXiv preprint arXiv:2012.06659},
year = {2020}
}
备注
Submitted to ICASSP 2021