自动语音识别中音素似然的校准
机器学习
2016-06-15 v1 机器学习
声音
摘要
在本文中,我们研究了使用深度神经网络(DNN)进行声学建模的语音识别系统中后验概率的概率性质。我们通过将 Kaldi 的 DNN 共享 pdf-id 后验概率还原为音素似然,并使用测试集强制对齐通过校准敏感的度量指标对其进行评估。原则上,单帧后验概率是校准良好的,因为 DNN 使用交叉熵作为目标函数进行训练,而交叉熵是一种严格评分规则。当评估整个音素时,我们观察到最好在音素持续时间内对对数似然取平均。用持续时间的对数对平均对数似然进行进一步缩放可略微改善校准,并且在独立测试数据上测试时这种改善得以保持。
引用
@article{arxiv.1606.04317,
title = {Calibration of Phone Likelihoods in Automatic Speech Recognition},
author = {David A. van Leeuwen and Joost van Doremalen},
journal= {arXiv preprint arXiv:1606.04317},
year = {2016}
}
备注
Rejected by Interspeech 2016. I would love to include the reviews, but there is no space for that here (400 characters)