用于联合语音增强与识别的 SNRi 目标训练
音频与语音处理
2022-03-29 v2 声音
摘要
语音增强(SE)被用作包括自动语音识别(ASR)和电信在内语音应用的前端。使用 SE 前端的一个困难在于,适当的降噪水平因应用和/或噪声特性而异。在本研究中,我们提出“信噪比改善(SNRi)目标训练”;SE 前端被训练为输出其 SNRi 由辅助标量输入控制的信号。在与后端联合训练时,目标 SNRi 值由辅助网络估计。通过训练所有网络以最小化后端任务损失,我们能在数据驱动方案中为每个噪声输入估计适当的降噪水平。我们的实验表明,SNRi 目标训练能够控制输出 SNRi。此外,与基于 Conformer 的标准 ASR 模型和传统的 SE-ASR 联合训练模型相比,所提联合训练分别使词错误率相对降低 4.0% 和 5.7%。进一步,通过分析预测的目标 SNRi,我们观察到联合训练的网络根据噪声特性自动控制信号 SNRi。音频演示可在我们的演示页面获取:google.github.io/df-conformer/snri_target/。
引用
@article{arxiv.2111.00764,
title = {SNRi Target Training for Joint Speech Enhancement and Recognition},
author = {Yuma Koizumi and Shigeki Karita and Arun Narayanan and Sankaran Panchapagesan and Michiel Bacchiani},
journal= {arXiv preprint arXiv:2111.00764},
year = {2022}
}
备注
Submitted to Interspeech 2022 (v1 has been rejected from ICASSP 2022)