通过解耦语音表征学习与变换改进无监督子词建模
音频与语音处理
2020-10-29 v2 机器学习
声音
摘要
本研究解决零资源场景下的无监督子词建模问题,仅使用目标语言的未转写语音,学习具有音素区分性且说话人不变的帧级语音表征。帧标签获取是解决该问题的重要步骤。高质量帧标签应与黄金转写良好一致,并对说话人变化具有鲁棒性。我们提出在先前采用的深度神经网络-瓶颈特征(DNN-BNF)架构中应用分解分层变分自编码器(FHVAE)来改进帧标签获取。FHVAE 学习解耦语音中编码的语言内容与说话人身份信息。通过丢弃或统一说话人信息,学习说话人不变特征,并将其作为输入送入 DPGMM 帧聚类和 DNN-BNF 训练。在 ZeroSpeech 2017 上进行的实验表明,与未应用 FHVAE 的基线 DNN-BNF 系统相比,我们提出的方法在跨说话人和说话人内条件下分别实现了 和 的绝对 ABX 错误率降低。我们提出的方法在改进帧标注和子词建模方面显著优于声道长度归一化。
引用
@article{arxiv.1906.07245,
title = {Improving Unsupervised Subword Modeling via Disentangled Speech Representation Learning and Transformation},
author = {Siyuan Feng and Tan Lee},
journal= {arXiv preprint arXiv:1906.07245},
year = {2020}
}
备注
5 pages, 3 figures, accepted for publication in INTERSPEECH 2019, Graz, Austria