中文

用于单通道语音增强的双分支注意力内注意力 Transformer

声音 2022-02-15 v5 人工智能 音频与语音处理

摘要

课程学习开始在语音增强领域兴起,其将原始频谱估计任务解耦为多个更简单的子任务以获得更好性能。受此启发,我们提出一种称为 DB-AIAT 的双分支注意力内注意力 Transformer,以并行处理频谱的粗粒度和细粒度区域。从互补视角出发,提出幅度掩蔽分支来粗略估计整体幅度谱,同时精心设计的复数细化分支用于补偿缺失的频谱细节并隐式推导相位信息。在每个分支内,我们提出一种新颖的基于注意力内注意力 Transformer 的模块,以替代传统的 RNN 和时序卷积网络进行时间序列建模。具体而言,所提注意力内注意力 Transformer 由自适应时频注意力 Transformer 块和自适应分层注意力模块组成,旨在捕获长期时频依赖并进一步聚合全局分层上下文信息。在 Voice Bank + DEMAND 上的实验结果表明,DB-AIAT 以较小的模型规模(2.81M)取得了优于以往先进系统的当前最优性能(如 PESQ 3.31、STOI 95.6%、SSNR 10.79dB)。

关键词

引用

@article{arxiv.2110.06467,
  title  = {Dual-branch Attention-In-Attention Transformer for single-channel speech enhancement},
  author = {Guochen Yu and Andong Li and Chengshi Zheng and Yinuo Guo and Yutian Wang and Hui Wang},
  journal= {arXiv preprint arXiv:2110.06467},
  year   = {2022}
}

备注

Accepted by ICASSP 2022