中文

基于回声感知损失的多任务深度残差回声抑制

声音 2022-05-31 v4 音频与语音处理

摘要

本文介绍西北工业大学团队在 ICASSP 2022 AEC 挑战赛中的参赛方案。我们采用将线性AEC与神经后滤波器级联的混合方法。前者用于处理线性回声分量,后者抑制残余非线性回声分量。我们使用门控卷积 F-T-LSTM 神经网络(GFTNN)作为主干,并通过多任务学习(MTL)框架塑造后滤波器,其中采用语音活动检测(VAD)模块作为回声抑制的辅助任务,旨在避免过度抑制导致语音失真。此外,我们采用回声感知损失函数,其中均方误差(MSE)损失可根据信回比(SER)对每个时频单元(TF-bin)特别优化,从而进一步抑制回声。广泛的消融研究表明,神经后滤波器中的时延估计(TDE)模块带来更好的感知质量,且具有更好收敛性的自适应滤波器会为后滤波器带来一致的性能提升。此外,我们发现将线性回声作为神经后滤波器的输入比直接使用参考信号是更好的选择。在 ICASSP 2022 AEC 挑战赛中,我们的方法在词准确率(WAcc)(0.817)上排名第 1,在平均意见得分(MOS)(4.502)和最终得分(0.864)上均排名第 3。

关键词

引用

@article{arxiv.2202.06850,
  title  = {Multi-Task Deep Residual Echo Suppression with Echo-aware Loss},
  author = {Shimin Zhang and Ziteng Wang and Jiayao Sun and Yihui Fu and Biao Tian and Qiang Fu and Lei Xie},
  journal= {arXiv preprint arXiv:2202.06850},
  year   = {2022}
}

备注

ICASSP 2022