中文

降低字符错误率不等于获得干净语音:面向黑盒声学模型ASR系统的语音增强

音频与语音处理 2022-02-23 v2 人工智能

摘要

本文提出一种基于深度神经网络(DNN)的语音增强(SE)方法,旨在最大化自动语音识别(ASR)系统的性能。为了使基于DNN的SE模型在字符错误率(CER)这一用于评估ASR系统且通常不可微的指标上得到优化,我们的方法使用两个DNN:一个用于语音处理,另一个用于模拟通过声学模型(AM)得到的输出CER。随后在训练阶段交替优化这两个DNN。即使AM是黑盒(例如由第三方提供),由于模拟AM的DNN是可微的,所提方法仍能使基于DNN的SE模型在CER上得到优化。因此,构建以CER为中心的SE模型在推理阶段不会产生额外计算成本、改变网络架构等负面影响成为可能,因为我们的方法仅仅是现有基于DNN方法的训练方案。实验结果表明,尽管保留了一定的噪声水平,所提方法通过黑盒AM使CER相对降低了8.8%。

关键词

引用

@article{arxiv.2110.05968,
  title  = {Improving Character Error Rate Is Not Equal to Having Clean Speech: Speech Enhancement for ASR Systems with Black-box Acoustic Models},
  author = {Ryosuke Sawata and Yosuke Kashiwagi and Shusuke Takahashi},
  journal= {arXiv preprint arXiv:2110.05968},
  year   = {2022}
}

备注

Accepted by ICASSP 2022