基于子带自回归包络联合去混响的端到端语音识别
音频与语音处理
2022-02-21 v2
摘要
端到端(E2E)自动语音识别(ASR)系统常被要求在混响条件下运行,其中语音的长期子带包络在时间上被模糊。本文开发了一种基于在子带时间包络上运行的神经模型的特征增强方法。时间包络使用频域线性预测(FDLP)框架建模。本文提出的神经增强模型执行基于包络增益的时间包络增强。模型架构由卷积与长短期记忆(LSTM)神经网络层的组合构成。此外,包络去混响、特征提取以及使用基于transformer的E2E ASR的声学建模均可针对语音识别任务进行联合优化。该联合优化确保去混响模型以ASR代价函数为目标。我们在REVERB挑战数据集以及VOiCES数据集上进行E2E语音识别实验。在这些实验中,所提出的联合建模方法相比基线E2E ASR系统取得了显著改进(在REVERB挑战数据集上平均相对改进21%,在VOiCES数据集上约10%)。
引用
@article{arxiv.2108.03975,
title = {End-to-End Speech Recognition With Joint Dereverberation Of Sub-Band Autoregressive Envelopes},
author = {Rohit Kumar and Anurenjan Purushothaman and Anirudh Sreeram and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2108.03975},
year = {2022}
}
备注
5 pages with refrences, e2e asr