TIMIT 音素识别任务上近期 DNN 架构综述
计算与语言
2018-06-22 v1 人机交互
摘要
在本综述论文中,我们评估了若干近期深度神经网络(DNN)架构在 TIMIT 音素识别任务上的表现。我们选择 TIMIT 语料库是由于其在学界广受欢迎且易获取。它也模拟了有助于小语种研究的低资源场景。此外,我们偏好音素识别任务,因其比大词汇连续语音识别(LVCSR)任务对声学模型质量敏感得多。近年来,许多 DNN 论文报告了 TIMIT 上的结果。然而,所报告的音素错误率(PER)常远高于简单前馈(FF)DNN 的 PER。这是本文的主要动机:提供带有开源脚本的基线 DNN,以便未来论文以尽可能低的 PER 轻松复现基线结果。据我们所知,本综述所取得的最佳 PER 优于迄今已发表的最佳 PER。
引用
@article{arxiv.1806.07974,
title = {A Survey of Recent DNN Architectures on the TIMIT Phone Recognition Task},
author = {Josef Michalek and Jan Vanek},
journal= {arXiv preprint arXiv:1806.07974},
year = {2018}
}
备注
Submitted to TSD 2018, 21st International Conference on Text, Speech and Dialogue. arXiv admin note: substantial text overlap with arXiv:1806.07186