中文

利用类别重参数化改进无监督 Sparsespeech 声学模型

音频与语音处理 2020-06-01 v1 计算与语言

摘要

Sparsespeech 模型是一种无监督声学模型,能够为未转录语音生成离散伪标签。我们扩展了 Sparsespeech 模型,使其能够在一个随机离散变量上进行采样,从而生成伪后验图。该后验图的稀疏度在模型训练完成后可以被完全控制。我们使用 Gumbel-Softmax 技巧在神经网络中近似地从离散分布进行采样,这使我们能够通过标准反向传播高效地训练网络。改进后的新模型在 Libri-Light 语料库上进行训练和评估,该语料库是用于有限或无监督 ASR 的基准。模型在 600 小时和 6000 小时的英语朗读语音上进行训练。我们使用 ABX 错误率指标以及包含 10 小时转录语音的半监督设置来评估改进后的模型。我们观察到,在使用 600 小时语音数据训练的改进版 Sparsespeech 模型上,测试集中跨说话人的 ABX 错误率相对改善了高达 31.4%,并且在将模型扩展至 6000 小时时获得了进一步的改善。

关键词

引用

@article{arxiv.2005.14578,
  title  = {Improving Unsupervised Sparsespeech Acoustic Models with Categorical Reparameterization},
  author = {Benjamin Milde and Chris Biemann},
  journal= {arXiv preprint arXiv:2005.14578},
  year   = {2020}
}