用于SE与ASR联合训练的多重置信门
音频与语音处理
2022-04-04 v1
摘要
语音增强模型(SE)与语音识别模型(ASR)的联合训练是噪声环境下鲁棒ASR的常用解决方案。SE侧重于改善语音的听觉质量,但增强后的特征分布发生改变,这种改变具有不确定性且对ASR有害。为应对这一挑战,提出了一种带有多重置信门用于SE和ASR联合训练的方法。设计了一个语音置信门预测模块以替代联合训练中原先的SE模块。噪声语音被门过滤以获得更易于被ASR网络拟合的特征。实验结果表明,所提方法在干净语音、合成噪声语音和真实噪声语音的测试集上均优于传统鲁棒语音识别系统。
引用
@article{arxiv.2204.00226,
title = {Multiple Confidence Gates For Joint Training Of SE And ASR},
author = {Tianrui Wang and Weibin Zhu and Yingying Gao and Junlan Feng and Shilei Zhang},
journal= {arXiv preprint arXiv:2204.00226},
year = {2022}
}
备注
5 pages