基于自动语音识别派生测度的非侵入式语音可懂度预测
音频与语音处理
2021-10-29 v2
摘要
语音可懂度的估计远未成为一个已解决的问题。尤其有一个方面存在问题:大多数标准模型需要干净的参考信号来估计可懂度。这是一个相当重要的问题,因为在实际应用中参考信号往往不可用。因此,本工作提出了一种非侵入式语音可懂度估计框架。在该框架中,使用从为自动语音识别(ASR)训练的模型派生出的可懂度测度来预测人类听者在关键词识别任务中的表现。这样一种基于 ASR 的测度与一种基于信号的测度被组合成一个完整的框架,即所提出的无参考可懂度(Nori)估计器,该估计器在预测正常听力和听力受损听者在多种噪声条件下的表现方面进行了评估。结果表明,在大多数考虑的场景中,Nori 框架甚至优于广泛使用的基于参考(或侵入式)的短时客观可懂度(STOI)测度,同时可应用于完全没有参考信号或转写文本的盲场景,为语音增强系统的在线和个性化优化创造了前景。
引用
@article{arxiv.2010.08574,
title = {Non-intrusive speech intelligibility prediction using automatic speech recognition derived measures},
author = {Mahdie Karbasi and Stefan Bleeck and Dorothea Kolossa},
journal= {arXiv preprint arXiv:2010.08574},
year = {2021}
}