面向非侵入式语音可懂度预测的自动语音识别无监督不确定性度量
音频与语音处理
2022-07-07 v2 声音
摘要
非侵入式可懂度预测因其在实际场景中的应用而十分重要,在这些场景中干净参考信号难以获取。许多非侵入式预测器的构建需要真实可懂度标签或干净参考信号以进行有监督学习。本工作中,我们利用一种无监督不确定性估计方法来预测语音可懂度,该方法不需要可懂度标签或参考信号来训练预测器。我们的实验表明,最先进的端到端自动语音识别(ASR)模型的不确定性与其语音可懂度高度相关。所提方法在两个数据库上进行了评估,结果表明ASR模型的无监督不确定性度量与试听结果得到的语音可懂度的相关性,高于广泛使用的侵入式方法的预测。
引用
@article{arxiv.2204.04288,
title = {Unsupervised Uncertainty Measures of Automatic Speech Recognition for Non-intrusive Speech Intelligibility Prediction},
author = {Zehai Tu and Ning Ma and Jon Barker},
journal= {arXiv preprint arXiv:2204.04288},
year = {2022}
}
备注
Accepted to INTERSPEECH2022