面向端到端抗噪语音识别的双路径风格学习
音频与语音处理
2023-05-30 v3 机器学习
声音
摘要
自动语音识别(ASR)系统在噪声条件下性能显著下降。近来,语音增强(SE)被引入作为前端以降低噪声以服务于ASR,但其也会抑制部分重要语音信息,即过抑制。为缓解此问题,我们提出一种面向端到端抗噪语音识别的双路径风格学习方法(DPSL-ASR)。具体而言,我们首先引入干净语音特征与来自IFF-Net的融合特征作为双路径输入以恢复被抑制的信息。随后,我们提出风格学习将融合特征映射至接近干净特征,从而从后者学习潜在语音信息,即干净“语音风格”。此外,我们还最小化两路径最终ASR输出之间的距离以提升抗噪性。实验表明,所提方法在RATS与CHiME-4数据集上相较最佳IFF-Net基线分别实现了10.6%与8.6%的相对词错误率(WER)降低。
引用
@article{arxiv.2203.14838,
title = {Dual-Path Style Learning for End-to-End Noise-Robust Speech Recognition},
author = {Yuchen Hu and Nana Hou and Chen Chen and Eng Siong Chng},
journal= {arXiv preprint arXiv:2203.14838},
year = {2023}
}
备注
5 pages, 3 figures, Accepted by InterSpeech 2023