用于无监督语音表征学习的卷积深度马尔可夫模型
音频与语音处理
2020-09-09 v2 计算与语言
机器学习
声音
摘要
概率潜变量模型(LVMs)为从语音中进行语言表征学习提供了一种替代自监督学习的方法。LVMs具有直观的概率解释,其中潜结构决定了从信号中提取的信息。尽管由于变分自编码器(VAEs)的引入,LVMs近来重新受到关注,但其在语音表征学习中的使用仍基本未被探索。在本工作中,我们提出卷积深度马尔可夫模型(ConvDMM),一种具有由深度神经网络建模的非线性发射与转移函数的高斯状态空间模型。该无监督模型使用黑盒变分推断进行训练。深度卷积神经网络被用作推断网络以进行结构化变分近似。在大规模语音数据集(LibriSpeech)上训练时,ConvDMM所提取的特征在Wall Street Journal数据集的线性音子分类与识别任务上显著优于多种自监督特征提取方法。此外,我们发现ConvDMM可补充Wav2Vec与PASE等自监督方法,改善单独使用任一方法所得的结果。最后,我们发现ConvDMM特征在极少标注训练样本的极端低资源情形下,能够实现优于任何其他特征的音子识别器学习。
引用
@article{arxiv.2006.02547,
title = {A Convolutional Deep Markov Model for Unsupervised Speech Representation Learning},
author = {Sameer Khurana and Antoine Laurent and Wei-Ning Hsu and Jan Chorowski and Adrian Lancucki and Ricard Marxer and James Glass},
journal= {arXiv preprint arXiv:2006.02547},
year = {2020}
}
备注
Proceedings of Interspeech, 2020