分析用于声学模型自适应的深度CNN话语嵌入
计算与语言
2018-11-13 v1
摘要
我们探究为何具有小型二维核的深度卷积神经网络(CNNs)——主要用于建模图像中的空间关系——在语音识别中也有效。我们在声学模型自适应的背景下分析深度CNN学习到的表示,并将其与深度神经网络(DNN)表示和i-vectors进行比较。为探索可从学习到的表示中解码出可解释信息与否,我们使用Aurora-4数据集评估它们区分说话人、声学条件、噪声类型和性别的能力。我们提取整体模型嵌入(以捕获整个网络学习的信息)和层特定嵌入,从而能够理解信息在网络中的流动。我们还将学习到的表示用作时间延迟神经网络(TDNN)在Aurora-4和MGB-3英语数据集上的额外输入。我们发现深度CNN嵌入在声学模型自适应上优于DNN嵌入,且基于深度CNN嵌入的辅助特征取得了与i-vectors相似的词错误率。
引用
@article{arxiv.1811.04708,
title = {Analyzing deep CNN-based utterance embeddings for acoustic model adaptation},
author = {Joanna Rownicka and Peter Bell and Steve Renals},
journal= {arXiv preprint arXiv:1811.04708},
year = {2018}
}
备注
accepted to SLT 2018