TENET:一种用于噪声鲁棒 ASR 的时间反转增强网络
音频与语音处理
2021-09-15 v3 声音
信号处理
摘要
由于深度学习带来的前所未有的突破,语音增强(SE)技术快速发展,并在声学建模之前发挥重要作用以缓解噪声对语音的影响。为提升语音的感知质量,当前 SE 领域最先进的方法通过将客观度量连接到判别器来采用对抗训练。然而,优化语音感知质量并不保证必然带来自动语音识别(ASR)性能的提升。在本研究中,我们提出 TENET,一种新颖的时间反转增强网络(Time-reversal Enhancement NETwork),它利用输入含噪信号自身的变换(即时间反转版本),结合孪生网络和复双路径 transformer,以提升面向噪声鲁棒 ASR 的 SE 性能。在 Voicebank-DEMAND 数据集上开展的广泛实验表明,在 SE 和 ASR 评价指标方面,TENET 相较几种顶尖方法均能取得最先进结果。为展示模型泛化能力,我们进一步在受未知噪声污染的场景测试集上评估 TENET,结果也证实了这一有前景方法的优越性。
引用
@article{arxiv.2107.01531,
title = {TENET: A Time-reversal Enhancement Network for Noise-robust ASR},
author = {Fu-An Chao and Shao-Wei Fan Jiang and Bi-Cheng Yan and Jeih-weih Hung and Berlin Chen},
journal= {arXiv preprint arXiv:2107.01531},
year = {2021}
}
备注
Accepted to ASRU 2021