中文

用于无监督声学词嵌入的对应变分自编码器

音频与语音处理 2020-12-07 v1 计算与语言 声音

摘要

我们提出了一种将可变时长语音段映射为固定维表示的新无监督模型。所得到的声学词嵌入可构成低资源与零资源语言的搜索、发现与索引系统的基础。我们的模型称为最大采样对应变分自编码器(MCVAE),是一种以新颖自监督对应损失训练的循环神经网络(RNN),该损失鼓励同一词不同实例的嵌入之间保持一致。我们的训练方案通过使用并比较近似后验分布的多个样本,改进了此前的对应训练方法。在零资源设定下,MCVAE可通过使用无监督词项发现系统发现的类词段,以无任何真值词对的无监督方式进行训练。在此设定以及半监督低资源设定(具有有限真值词对集合)下,MCVAE均优于此前最先进的模型,如基于Siamese、CAE和VAE的RNN。

关键词

引用

@article{arxiv.2012.02221,
  title  = {A Correspondence Variational Autoencoder for Unsupervised Acoustic Word Embeddings},
  author = {Puyuan Peng and Herman Kamper and Karen Livescu},
  journal= {arXiv preprint arXiv:2012.02221},
  year   = {2020}
}

备注

10 pages, 6 figures, NeurIPS 2020 Workshop Self-Supervised Learning for Speech and Audio Processing