使用 WaveNet 自编码器的无监督语音表征学习
机器学习
2019-09-12 v2 音频与语音处理
机器学习
摘要
我们考虑通过将自编码神经网络应用于语音波形,来无监督地提取有意义的语音潜在表征的任务。目标是学习一种能够从信号中捕获高级语义内容(例如音素身份)的表征,同时对信号中易混淆的低级细节(如基频轮廓或背景噪声)保持不变性。由于学习到的表征被调整为仅包含语音内容,我们诉诸使用高容量的 WaveNet 解码器,从先前的样本中推断被编码器丢弃的信息。此外,自编码器模型的行为取决于应用于潜在表征的约束类型。我们比较了三种变体:简单的降维瓶颈、高斯变分自编码器(VAE)和离散向量量化 VAE(VQ-VAE)。我们从说话人无关性、预测语音内容的能力以及准确重建单个频谱图帧的能力这几个方面,分析了所学表征的质量。此外,对于使用 VQ-VAE 提取的离散编码,我们测量了将其映射到音素的难易程度。我们引入了一种正则化方案,迫使表征关注话语的语音内容,并报告了与 ZeroSpeech 2017 无监督声学单元发现任务中顶级参赛者相当的性能。
引用
@article{arxiv.1901.08810,
title = {Unsupervised speech representation learning using WaveNet autoencoders},
author = {Jan Chorowski and Ron J. Weiss and Samy Bengio and Aäron van den Oord},
journal= {arXiv preprint arXiv:1901.08810},
year = {2019}
}
备注
Accepted to IEEE TASLP, final version available at http://dx.doi.org/10.1109/TASLP.2019.2938863