时域音频分离与识别的端到端训练
音频与语音处理
2020-04-14 v3 计算与语言
声音
摘要
对单通道多说话人语音分离的兴趣上升推动了多说话人语音识别端到端 (E2E) 方法的发展。然而,迄今为止,基于神经网络的最先进时域源分离尚未与 E2E 语音识别结合。我们在此展示如何将基于卷积时域音频分离网络 (Conv-TasNet) 的分离模块与 E2E 语音识别器结合,并通过将模型分布到多个 GPU 或对卷积前端近似截断反向传播来联合训练此类模型。为使本工作具有参照并说明设计空间的复杂性,我们提供了单通道多说话人识别系统的简明概览。我们的实验在 WSJ0-2mix 上显示了 11.0% 的词错误率,并表明我们的联合时域模型可比较迄今提出的级联 DNN-HMM 与整体 E2E 频域系统取得实质性改进。
引用
@article{arxiv.1912.08462,
title = {End-to-end training of time domain audio separation and recognition},
author = {Thilo von Neumann and Keisuke Kinoshita and Lukas Drude and Christoph Boeddeker and Marc Delcroix and Tomohiro Nakatani and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:1912.08462},
year = {2020}
}
备注
5 pages, 1 figure, to appear in ICASSP 2020