优化基于CD-DNN的音素识别中用于低延迟处理的输入窗口对齐
计算与语言
2016-06-30 v1 计算机视觉与模式识别
神经与进化计算
机器学习
摘要
我们针对输入特征窗口相对于当前帧非对称时音素识别器的性能进行了系统分析。该识别器基于上下文相关深度神经网络(CD-DNNs)与隐马尔可夫模型(HMMs)。目标是通过减少估计当前输出所需的未来特征帧数来降低系统延迟。我们在TIMIT数据库上的测试表明,与常规做法(无未来帧)相比,当输入窗口向过去偏移最多5帧时,性能并未下降。这对应于在我们的设置中将延迟改善了50 ms。我们的测试还表明,最佳结果并非通过使用通常采用的对称窗口获得,而是通过具有8个过去帧和2个未来帧的非对称窗口获得,尽管这一观察应在其他数据集上得到确认。我们的结果所建议的延迟降低对于诸如远程呈现的实时唇形同步等特定应用至关重要,但也可能是有益的,以普遍应用于改善人机语音交互中的滞后。
引用
@article{arxiv.1606.09163,
title = {Optimising The Input Window Alignment in CD-DNN Based Phoneme Recognition for Low Latency Processing},
author = {Akash Kumar Dhaka and Giampiero Salvi},
journal= {arXiv preprint arXiv:1606.09163},
year = {2016}
}
备注
4 pages, 3 figures