面向端到端抗噪语音识别的交互式特征融合
音频与语音处理
2022-04-11 v2 机器学习
声音
摘要
语音增强(SE)旨在从带噪语音信号中抑制加性噪声,以改善语音的感知质量与可懂度。然而,增强语音中的过抑制现象可能因潜在信息缺失而降低下游自动语音识别(ASR)任务性能。为缓解该问题,我们提出一种交互式特征融合网络(IFF-Net)用于抗噪语音识别,以从增强特征与原始带噪特征中学习互补信息。实验结果表明,所提方法在RATS Channel-A语料库上相较最佳基线实现词错误率(WER)绝对降低4.1%。我们的进一步分析表明,所提IFF-Net可补充过抑制增强特征中缺失的部分信息。
引用
@article{arxiv.2110.05267,
title = {Interactive Feature Fusion for End-to-End Noise-Robust Speech Recognition},
author = {Yuchen Hu and Nana Hou and Chen Chen and Eng Siong Chng},
journal= {arXiv preprint arXiv:2110.05267},
year = {2022}
}
备注
5 pages, 7 figures, Accepted by ICASSP 2022