中文

语音增强在自动语音识别中的双重应用

声音 2020-11-10 v1 音频与语音处理

摘要

在本工作中,我们利用语音增强来改进基于循环神经网络转导器(RNN-T)的 ASR 系统。我们采用稠密卷积循环网络(DCRN)进行基于复谱映射的语音增强,并发现它从两方面有助于 ASR:作为数据增强技术和作为预处理前端。将其用于 ASR 数据增强时,我们利用在原始语音与增强语音的 ASR 输出之间计算的基于 KL 散度的一致性损失。将语音增强用作有效的 ASR 前端时,我们提出了一种基于模型预训练与特征选择的三步训练方案。我们在一个具有挑战性的社交媒体英文视频数据集上评估了所提出的技术,通过基于语音增强的数据增强取得了 11.2% 的平均相对提升,通过基于增强的预处理取得了 8.3% 的平均相对提升,而两者结合时取得了 13.4% 的平均相对提升。

关键词

引用

@article{arxiv.2011.03840,
  title  = {Dual Application of Speech Enhancement for Automatic Speech Recognition},
  author = {Ashutosh Pandey and Chunxi Liu and Yun Wang and Yatharth Saraf},
  journal= {arXiv preprint arXiv:2011.03840},
  year   = {2020}
}

备注

Accepted for publication in SLT 2021