用于方言识别的语音无监督表示学习
音频与语音处理
2018-09-13 v1 计算与语言
机器学习
摘要
在本文中,我们探索使用因子化分层变分自编码器(FHVAE)模型来学习用于方言识别(DID)的无监督潜在表示。FHVAE可以通过将两个不同的潜在变量集合分别编码,从而学习到将话语中较静态属性与较动态属性分离的潜在空间。用于方言识别的有用因子(如语音或语言内容)由段级潜在变量编码,而序列内相对恒定的无关因子(如信道或说话人信息)由序列级潜在变量编码。这种解耦特性使得段级潜在变量较少受信道和说话人变化的影响,从而减少了信道域失配带来的性能下降。我们证明,在完全监督的DID任务上,基于FHVAE模型提取特征训练的端到端模型取得了最佳性能,优于在相同模型上基于传统声学特征和基于i-vector的系统训练的结果。此外,我们还表明,所提出的方法可以利用大量无标签数据进行FHVAE训练,以学习用于DID的域不变特征,并在低资源条件下(即域内数据标签不可用时)显著提升性能。
引用
@article{arxiv.1809.04458,
title = {Unsupervised Representation Learning of Speech for Dialect Identification},
author = {Suwon Shon and Wei-Ning Hsu and James Glass},
journal= {arXiv preprint arXiv:1809.04458},
year = {2018}
}
备注
Accepted at SLT 2018