语音中辅音可懂度度量的自动估计
音频与语音处理
2021-03-29 v2 计算与语言
声音
摘要
在本文中,我们提供了一种模型来估计单个语音片段可懂度的实值度量。我们基于卷积神经网络(CNN)训练了回归模型,用于与元音 \textipa{/A/} 相关的塞音 \textipa{/p,t,k,b,d,g/},以估计辅音-元音(CV)声音对于正常听力(NH)耳朵变得可懂时对应的信噪比(SNR)。每种声音的可懂度度量称为 SNR,定义为根据先前对 NH 受试者的实验确定,人类参与者平均能够至少 90% 正确识别该辅音时的 SNR 水平。将 CNN 的性能与基于自动语音识别(ASR)的基线预测进行比较,具体而言,该基线预测为从 ASR 能够正确标注辅音时的 SNR 中减去一个恒定偏移量。与基线相比,我们的模型能够准确估计 SNR 可懂度度量,平均均方误差(MSE)小于 2 [dB],而基线 ASR 定义的度量计算 SNR 的方差为 5.2 至 26.6 [dB],具体取决于辅音。
引用
@article{arxiv.2005.06065,
title = {Automatic Estimation of Intelligibility Measure for Consonants in Speech},
author = {Ali Abavisani and Mark Hasegawa-Johnson},
journal= {arXiv preprint arXiv:2005.06065},
year = {2021}
}
备注
5 pages, 1 figure, 7 tables, submitted to Inter Speech 2020 Conference