端到端噪声鲁棒语音识别中多任务学习的梯度补救
音频与语音处理
2023-05-04 v2 机器学习
声音
摘要
语音增强(SE)被证明能有效从带噪语音信号中降噪以用于下游自动语音识别(ASR),其中采用多任务学习策略联合优化这两个任务。然而,由SE目标学习到的增强语音未必总能产生良好的ASR结果。从优化视角看,SE与ASR任务的梯度之间有时存在干扰,可能阻碍多任务学习并最终导致次优的ASR性能。本文提出一种简单而有效的方法——梯度补救(GR),从角度与幅值两方面解决噪声鲁棒语音识别中任务梯度间的干扰。具体而言,我们首先将SE任务的梯度投影到与ASR梯度成锐角的动态曲面上,以消除二者冲突并辅助ASR优化。此外,我们自适应地重缩放两个梯度的幅值,防止主导的ASR任务被SE梯度误导。实验结果表明,所提方法良好地解决了梯度干扰,在RATS与CHiME-4数据集上分别相较多任务学习基线取得9.3%与11.1%的相对词错误率(WER)降低。我们的代码已在GitHub上提供。
引用
@article{arxiv.2302.11362,
title = {Gradient Remedy for Multi-Task Learning in End-to-End Noise-Robust Speech Recognition},
author = {Yuchen Hu and Chen Chen and Ruizhe Li and Qiushi Zhu and Eng Siong Chng},
journal= {arXiv preprint arXiv:2302.11362},
year = {2023}
}
备注
5 pages, 5 figures, Accepted by ICASSP 2023