中文

用于语音识别的具有自适应感受野的可变形 TDNN

音频与语音处理 2021-05-03 v1 计算与语言 声音

摘要

时间延迟神经网络(TDNNs)广泛应用于基于 DNN-HMM 的混合语音识别系统以及近期端到端系统中。然而,TDNN 的感受野有限且固定,这对于语音识别等任务并不理想,因为语音的时间动态变化且受诸多因素影响。本文提出在端到端语音识别中使用可变形 TDNN 进行自适应时间动态建模。受可变形 ConvNets 启发,可变形 TDNN 以额外偏移增强时间采样位置,并基于 ASR 准则自动学习偏移,无需额外监督。实验表明可变形 TDNN 在 WSJ 基准上取得了最先进结果(在 WSJ eval92/dev93 上分别达到 1.42%/3.45% WER),显著优于标准 TDNN。此外,我们提出可变形 TDNN 的延迟控制机制,使可变形 TDNN 能够在不降低精度的情况下进行流式 ASR。

关键词

引用

@article{arxiv.2104.14791,
  title  = {Deformable TDNN with adaptive receptive fields for speech recognition},
  author = {Keyu An and Yi Zhang and Zhijian Ou},
  journal= {arXiv preprint arXiv:2104.14791},
  year   = {2021}
}

备注

5 pages. submitted to Interspeech 2021