中文

用于近讲与远讲语音联合识别的带编码器选择的双编码器架构

音频与语音处理 2021-09-21 v1 机器学习

摘要

本文提出一种用于近讲(CT)与远讲(FT)语音联合建模的双编码器ASR架构,以结合CT与FT设备的优势获得更好准确率。核心思想是添加编码器选择网络以选取最优输入源(CT或FT)及对应编码器。我们对CT语音使用单通道编码器,对FT语音使用带空间滤波神经波束形成的多通道编码器,并与编码器选择联合训练。我们在基于注意力与RNN Transducer的端到端ASR系统上验证方法。实验采用来自医疗用例的对话语音,由CT设备与麦克风阵列同时录制。结果表明,相较于在匹配条件下训练与测试的最佳单编码器系统,所提双编码器架构在使用CT与FT输入时取得最高9%的相对WER降低。

关键词

引用

@article{arxiv.2109.08744,
  title  = {Dual-Encoder Architecture with Encoder Selection for Joint Close-Talk and Far-Talk Speech Recognition},
  author = {Felix Weninger and Marco Gaudesi and Ralf Leibold and Roberto Gemello and Puming Zhan},
  journal= {arXiv preprint arXiv:2109.08744},
  year   = {2021}
}

备注

To appear in ASRU 2021