中文

语音中辅音可懂度度量的自动估计

音频与语音处理 2021-03-29 v2 计算与语言 声音

摘要

在本文中,我们提供了一种模型来估计单个语音片段可懂度的实值度量。我们基于卷积神经网络(CNN)训练了回归模型,用于与元音 \textipa{/A/} 相关的塞音 \textipa{/p,t,k,b,d,g/},以估计辅音-元音(CV)声音对于正常听力(NH)耳朵变得可懂时对应的信噪比(SNR)。每种声音的可懂度度量称为 SNR90_{90},定义为根据先前对 NH 受试者的实验确定,人类参与者平均能够至少 90% 正确识别该辅音时的 SNR 水平。将 CNN 的性能与基于自动语音识别(ASR)的基线预测进行比较,具体而言,该基线预测为从 ASR 能够正确标注辅音时的 SNR 中减去一个恒定偏移量。与基线相比,我们的模型能够准确估计 SNR90_{90} 可懂度度量,平均均方误差(MSE)小于 2 [dB2^2],而基线 ASR 定义的度量计算 SNR90_{90} 的方差为 5.2 至 26.6 [dB2^2],具体取决于辅音。

关键词

引用

@article{arxiv.2005.06065,
  title  = {Automatic Estimation of Intelligibility Measure for Consonants in Speech},
  author = {Ali Abavisani and Mark Hasegawa-Johnson},
  journal= {arXiv preprint arXiv:2005.06065},
  year   = {2021}
}

备注

5 pages, 1 figure, 7 tables, submitted to Inter Speech 2020 Conference