用于半监督语音识别的深度上下文声学表示
音频与语音处理
2020-05-15 v2 计算与语言
机器学习
声音
摘要
我们提出了一种用于半监督自动语音识别(ASR)的新方法。我们首先通过表示学习利用大量无标签音频数据,从过去和未来的上下文帧重建滤波器组特征的时间切片。由此得到的深度上下文声学表示(DeCoAR)随后用于以较少量的有标签音频数据训练基于 CTC 的端到端 ASR 系统。在我们的实验中,我们表明在 DeCoAR 上训练的系统始终优于在常规滤波器组特征上训练的系统,在 WSJ eval92 和 LibriSpeech test-clean 上分别比基线相对提升 42% 和 19%。我们的方法可大幅减少所需的有标签数据量;在 LibriSpeech 上进行无监督训练、再以 100 小时有标签数据监督,可达到直接使用全部 960 小时训练的性能。预训练模型与代码将在线发布。
引用
@article{arxiv.1912.01679,
title = {Deep Contextualized Acoustic Representations For Semi-Supervised Speech Recognition},
author = {Shaoshi Ling and Yuzong Liu and Julian Salazar and Katrin Kirchhoff},
journal= {arXiv preprint arXiv:1912.01679},
year = {2020}
}
备注
Accepted to ICASSP 2020 (oral)