语音特征与声学标记的无监督迭代深度学习及其在口语词检测中的应用
计算与语言
2017-07-19 v1
摘要
本文旨在直接从无标注语音数据中自动发现高质量的帧级语音特征和声学标记。我们提出了一种多粒度声学标记器(MAT),用于从给定语料库中自动发现多组声学标记。每组声学标记由一组描述模型配置的超参数指定。这些不同的声学标记集携带了针对给定语料库及其背后语言的不同特征,因此可以相互增强。随后,将这些多组标记标签作为多目标深度神经网络(MDNN)的目标,该网络在帧级声学特征上进行训练。从 MDNN 提取的瓶颈特征随后被用作反馈输入,送入下一轮迭代中的 MAT 和 MDNN 本身。多粒度声学标记集和帧级语音特征可在迭代深度学习框架中得到迭代优化。我们将此框架称为多粒度声学标记深度神经网络(MATDNN)。利用 Interspeech 2015 举办的零资源语音挑战(Zero Resource Speech Challenge)中定义的指标和语料库对结果进行了评估,并在同一语料库上进行示例查询口语词检测的一系列实验中获得了性能提升。此外,还展示了所发现的标记与英语音素之间的可视化对比。
引用
@article{arxiv.1707.05315,
title = {Unsupervised Iterative Deep Learning of Speech Features and Acoustic Tokens with Applications to Spoken Term Detection},
author = {Cheng-Tao Chung and Cheng-Yu Tsai and Chia-Hsiang Liu and Lin-Shan Lee},
journal= {arXiv preprint arXiv:1707.05315},
year = {2017}
}
备注
Accepted by IEEE/ACM Transactions on Audio Speech and Language Processing. arXiv admin note: text overlap with arXiv:1602.00426, arXiv:1506.02327