中文

用于单通道语音增强的时频注意力

声音 2022-03-10 v3 音频与语音处理

摘要

大多数语音增强研究通常不考虑语音在时频(T-F)表示中的能量分布,而这对于准确预测掩码或频谱十分重要。本文提出一个简单而有效的时频注意力(TFA)模块,其生成二维注意力图,为 T-F 表示的频谱分量提供差异化权重。为验证所提 TFA 模块的有效性,我们使用残差时间卷积网络(ResTCN)作为主干网络,并在两种常用训练目标上进行了充分实验。实验表明,应用我们的 TFA 模块以可忽略的参数开销在五项客观评价指标上显著提升了性能。评估结果指出,所提出的带 TFA 模块的 ResTCN(ResTCN+TFA)持续大幅优于其他基线。

关键词

引用

@article{arxiv.2111.07518,
  title  = {Time-Frequency Attention for Monaural Speech Enhancement},
  author = {Qiquan Zhang and Qi Song and Zhaoheng Ni and Aaron Nicolson and Haizhou Li},
  journal= {arXiv preprint arXiv:2111.07518},
  year   = {2022}
}

备注

5 pages, 4 figures, Accepted and presented at ICASSP 2022