中文

用于语音去混响的复值时频自注意力

音频与语音处理 2022-11-24 v1 机器学习 声音 信号处理

摘要

当深度复值神经网络(DCNN)与自注意力(SA)网络结合时,若干语音处理系统已展现出显著的性能提升。然而,大多数采用自注意力的基于 DCNN 的语音去混响研究,在计算注意力时并未显式考虑实部与虚部特征之间的相互依赖关系。在本研究中,我们提出一种复值 T-F 注意力(TFA)模块,该模块通过跨时间和频率维度计算二维注意力图来建模频谱与时序依赖关系。我们使用 REVERB challenge 语料库,以深度复值卷积循环网络(DCCRN)验证了所提复值 TFA 模块的有效性。实验结果表明,与早期自注意力方法相比,将我们的 complex-TFA 模块与 DCCRN 结合可提升整体语音质量及后端语音应用(如自动语音识别)的性能。

关键词

引用

@article{arxiv.2211.12632,
  title  = {Complex-Valued Time-Frequency Self-Attention for Speech Dereverberation},
  author = {Vinay Kothapally and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2211.12632},
  year   = {2022}
}

备注

Interspeech 2022: ISCA Best Student Paper Award Finalist