基于CNN的多通道端到端语音识别用于日常家庭环境
音频与语音处理
2019-06-24 v3 计算与语言
声音
摘要
涉及多说话人及周围设备噪声的随意对话在日常环境中十分常见,这会降低自动语音识别系统的性能。这些具有挑战性的环境特征是CHiME-5挑战赛的目标。通过采用基于卷积神经网络(CNN)的多通道端到端语音识别系统,本研究试图克服日常环境中的现有困难。该系统由基于注意力的编码器-解码器神经网络组成,直接从声音输入生成文本输出。使用残差连接和批量重归一化的多通道CNN编码器,利用包含白噪声注入的增强数据进行训练。实验结果表明,在CHiME-5语料库上,词错误率相较单通道端到端系统和最佳基线(LF-MMI TDNN)分别绝对降低了8.5%和0.6%。
引用
@article{arxiv.1811.02735,
title = {CNN-based MultiChannel End-to-End Speech Recognition for everyday home environments},
author = {Nelson Yalta and Shinji Watanabe and Takaaki Hori and Kazuhiro Nakadai and Tetsuya Ogata},
journal= {arXiv preprint arXiv:1811.02735},
year = {2019}
}
备注
5 pages, 1 figure, EUSIPCO 2019