用于无监督声学单元发现的潜在狄利克雷分配时序扩展
音频与语音处理
2022-06-30 v2 计算与语言
机器学习
机器学习
摘要
潜在狄利克雷分配(LDA)广泛用于文档集合上的无监督主题建模。该模型未使用时序信息。然而,连续词符的对应主题之间往往存在关联。在本文中,我们提出 LDA 的一种扩展,利用马尔可夫链对时序信息建模。我们将这一新模型用于语音中的声学单元发现。模型以向量量化(VQ)神经网络(含 512 个码本)的语音离散化编码作为输入词符。目标是将这 512 个 VQ 码映射到 50 个类音素单元(主题),以更接近真实音素。与仅考虑 VQ 码在话语(文档)内共现的基础 LDA 不同,马尔可夫链 LDA 额外捕捉连续码之间的相继关系。与基础 LDA 相比,该扩展提升了聚类质量与音素分割结果。与近期同样学习 50 个单元的向量量化神经网络方法相比,扩展 LDA 模型在音素分割上表现更优,但在互信息上表现更差。
引用
@article{arxiv.2206.11706,
title = {A Temporal Extension of Latent Dirichlet Allocation for Unsupervised Acoustic Unit Discovery},
author = {Werner van der Merwe and Herman Kamper and Johan du Preez},
journal= {arXiv preprint arXiv:2206.11706},
year = {2022}
}