利用类别重参数化改进无监督 Sparsespeech 声学模型
音频与语音处理
2020-06-01 v1 计算与语言
摘要
Sparsespeech 模型是一种无监督声学模型,能够为未转录语音生成离散伪标签。我们扩展了 Sparsespeech 模型,使其能够在一个随机离散变量上进行采样,从而生成伪后验图。该后验图的稀疏度在模型训练完成后可以被完全控制。我们使用 Gumbel-Softmax 技巧在神经网络中近似地从离散分布进行采样,这使我们能够通过标准反向传播高效地训练网络。改进后的新模型在 Libri-Light 语料库上进行训练和评估,该语料库是用于有限或无监督 ASR 的基准。模型在 600 小时和 6000 小时的英语朗读语音上进行训练。我们使用 ABX 错误率指标以及包含 10 小时转录语音的半监督设置来评估改进后的模型。我们观察到,在使用 600 小时语音数据训练的改进版 Sparsespeech 模型上,测试集中跨说话人的 ABX 错误率相对改善了高达 31.4%,并且在将模型扩展至 6000 小时时获得了进一步的改善。
引用
@article{arxiv.2005.14578,
title = {Improving Unsupervised Sparsespeech Acoustic Models with Categorical Reparameterization},
author = {Benjamin Milde and Chris Biemann},
journal= {arXiv preprint arXiv:2005.14578},
year = {2020}
}