中文

基于重叠帧信息融合和因果自注意力的语音增强

音频与语音处理 2025-01-22 v1 声音

摘要

对于时频(TF)域语音增强(SE)方法,逆TF变换中的重叠-叠加操作必然导致等于窗口大小的算法延迟。然而,典型的因果SE系统未能利用这一固有的延迟内的未来语音信息,从而限制了SE性能。本文提出了一种重叠帧信息融合方案。在每个帧索引处,我们构建了几个伪重叠帧,将其与原始语音帧融合,然后将融合结果发送给SE模型。此外,我们引入了一种因果时频-channel注意力(TFCA)块来提升神经网络的表征能力。该块通过在时、频、channel维度中基于自注意力的操作并行处理中间特征图。实验结果表明,这些改进的优势显著,并且提出的SE系统超过了当前先进的方法。

关键词

引用

@article{arxiv.2501.12004,
  title  = {Speech Enhancement with Overlapped-Frame Information Fusion and Causal Self-Attention},
  author = {Yuewei Zhang and Huanbin Zou and Jie Zhu},
  journal= {arXiv preprint arXiv:2501.12004},
  year   = {2025}
}

备注

Accepted by ICASSP 2025