中文

声学引导评估(AGE):一种用于估计鲁棒 ASR 中语音增强算法性能的新度量

音频与语音处理 2018-11-29 v1 声音

摘要

鲁棒自动语音识别(ASR)的一个挑战性问题是如何在不计算词错误率(WER)的情况下衡量语音增强算法(SEA)的优劣,因为人工转写、语言建模和解码过程成本高昂。用于评估语音质量和可懂度的传统度量如 PESQ 和 STOI 已被证实与 WER 相关性较低。本研究提出一种新颖的声学引导评估(AGE)度量,用于估计 SEA 在鲁棒 ASR 中的性能。AGE 包含三个连续步骤,即经由特征提取的低层表示、经由声学模型(AM)非线性映射的高层表示,以及干净语音与退化语音表示之间最终的 AGE 计算。具体而言,采用基于神经网络的 AM 的状态后验概率作为高层表示,并使用交叉熵准则计算 AGE。实验表明,与 PESQ、STOI 以及使用熵的声学置信度度量相比,AGE 能一致地产生与 WER 的最高相关性,并给出最准确的 ASR 性能估计。潜在地,AGE 可用于指导基于深度学习的 SEA 的参数优化,以进一步提升识别性能。

关键词

引用

@article{arxiv.1811.11517,
  title  = {Acoustics-guided evaluation (AGE): a new measure for estimating performance of speech enhancement algorithms for robust ASR},
  author = {Li Chai and Jun Du and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:1811.11517},
  year   = {2018}
}

备注

Submitted to ICASSP 2019