用于单通道语音增强的时频注意力
声音
2022-03-10 v3 音频与语音处理
摘要
大多数语音增强研究通常不考虑语音在时频(T-F)表示中的能量分布,而这对于准确预测掩码或频谱十分重要。本文提出一个简单而有效的时频注意力(TFA)模块,其生成二维注意力图,为 T-F 表示的频谱分量提供差异化权重。为验证所提 TFA 模块的有效性,我们使用残差时间卷积网络(ResTCN)作为主干网络,并在两种常用训练目标上进行了充分实验。实验表明,应用我们的 TFA 模块以可忽略的参数开销在五项客观评价指标上显著提升了性能。评估结果指出,所提出的带 TFA 模块的 ResTCN(ResTCN+TFA)持续大幅优于其他基线。
引用
@article{arxiv.2111.07518,
title = {Time-Frequency Attention for Monaural Speech Enhancement},
author = {Qiquan Zhang and Qi Song and Zhaoheng Ni and Aaron Nicolson and Haizhou Li},
journal= {arXiv preprint arXiv:2111.07518},
year = {2022}
}
备注
5 pages, 4 figures, Accepted and presented at ICASSP 2022