用于提升鲁棒自动语音识别的掩码标量预测
音频与语音处理
2022-04-27 v1 声音
摘要
使用基于神经网络的声学前端来提升流式自动语音识别(ASR)系统的鲁棒性具有挑战性,这是由于因果性约束以及前端处理在语音中引入的失真。基于时频掩码的方法已被证明效果良好,但它们需要额外的超参数来缩放掩码以限制语音失真。此类掩码标量通常经过手工调优且保守地选取。在本工作中,我们提出了一种以端到端方式使用基于ASR的损失来预测掩码标量的技术,整体模型规模与复杂度增加极小。我们在两个鲁棒ASR任务上评估该方法:存在语音与非语音噪声下的多通道增强,以及声学回声消除(AEC)。结果表明,所提出的算法在无需任何额外调优的情况下,相较于使用手工调优超参数的强基线一致地降低了词错误率(WER):在多通道噪声条件下最高降低16%,在AEC下最高降低7%。
引用
@article{arxiv.2204.12092,
title = {Mask scalar prediction for improving robust automatic speech recognition},
author = {Arun Narayanan and James Walker and Sankaran Panchapagesan and Nathan Howard and Yuma Koizumi},
journal= {arXiv preprint arXiv:2204.12092},
year = {2022}
}
备注
Submitted to Interspeech 2022