基于生成对抗网络与迭代精炼隐马尔可夫模型协同的完全无监督语音识别
计算与语言
2019-08-26 v3 声音
音频与语音处理
摘要
为全球超过95%的低资源语言构建用于训练ASR系统的大规模标注语音语料库仍然困难,但为这类语言收集相对较大的无标签数据集则更为可行。这正是已有一些基于纯无标签数据学习的完全无监督语音识别初步尝试被报道的原因,尽管其错误率相对较高。本文中,我们开发了一个生成对抗网络(GAN)以实现此目标,其中生成器与判别器通过迭代相互学习来提升性能。我们进一步使用一组由机器生成标签迭代精炼得到的隐马尔可夫模型(HMMs)与GAN协同工作。在TIMIT数据集上的初步实验取得了33.1%的音素错误率,比此前最先进水平低8.5%。
引用
@article{arxiv.1904.04100,
title = {Completely Unsupervised Speech Recognition By A Generative Adversarial Network Harmonized With Iteratively Refined Hidden Markov Models},
author = {Kuan-Yu Chen and Che-Ping Tsai and Da-Rong Liu and Hung-Yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1904.04100},
year = {2019}
}
备注
Accepted by Interspeech 2019