中文

一种用于语音无监督分割与聚类的嵌入式分段K均值模型

计算与语言 2017-09-06 v2 机器学习

摘要

无标注语音的无监督分割与聚类是零资源语音处理中的核心问题。大多数方法处于方法论上的两个极端:一些使用具有收敛保证的概率贝叶斯模型,而另一些则选择更高效的启发式技术。尽管在先前工作中表现出有竞争力的性能,但完整的贝叶斯方法难以扩展到大型语音语料库。我们引入了一种对最近贝叶斯模型的近似,该近似仍具有明确的目标函数,但通过使用硬聚类和硬分割而非完整的贝叶斯推断来提高效率。与其贝叶斯对应模型一样,这种嵌入式分段K均值模型(ES-KMeans)将任意长度的词段表示为固定维度的声学词嵌入。我们首先在常见的英语和 Xitsonga 数据集(5 小时和 2.5 小时语音)上将 ES-KMeans 与先前的方法进行比较:ES-KMeans 在词分割方面优于一种领先的启发式方法,得分与贝叶斯模型相似,但速度快 5 倍且超参数更少。然而,其聚类的纯度低于其他模型。然后,我们通过将 ES-KMeans 应用于 2017 年零资源语音挑战赛的 5 种语言(最长 45 小时)来展示其可扩展到更大的语料库,在该挑战赛中,其性能与基线相比具有竞争力。

关键词

引用

@article{arxiv.1703.08135,
  title  = {An embedded segmental K-means model for unsupervised segmentation and clustering of speech},
  author = {Herman Kamper and Karen Livescu and Sharon Goldwater},
  journal= {arXiv preprint arXiv:1703.08135},
  year   = {2017}
}

备注

8 pages, 3 figures, 3 tables; accepted to ASRU 2017