中文

采用可分离池化注意力与全局层归一化接 PReLU 的语音增强

声音 2021-05-07 v1 人工智能 音频与语音处理

摘要

单通道语音增强是语音领域的一项具有挑战性的任务。近来,多种基于神经网络的方法已被应用于语音增强。在这些模型中,PHASEN 与 T-GSA 在公开数据集 VoiceBank+DEMAND 上取得了最先进的性能。两个模型的 COVL 分数均达到 3.62。PHASEN 取得了最高的 CSIG 分数 4.21,而 T-GSA 取得了最高的 PESQ 分数 3.06。然而,这两个模型都非常庞大。模型性能与模型规模之间的矛盾难以调和。本文中,我们引入三种技术来压缩 PHASEN 模型并提升性能。首先,提出可分离池化注意力以替换 PHASEN 中的频率变换模块。其次,采用全局层归一化接 PReLU 来替换批归一化接 ReLU。最后,将 PHASEN 中的 BLSTM 替换为 Conv2d 操作,并简化相位流。经上述修改,PHASEN 模型规模从 3300 万参数缩减至 500 万参数,同时在 VoiceBank+DEMAND 上的性能提升至 CSIG 分数 4.30、PESQ 分数 3.07 与 COVL 分数 3.73。

关键词

引用

@article{arxiv.2105.02509,
  title  = {Speech Enhancement using Separable Polling Attention and Global Layer Normalization followed with PReLU},
  author = {Dengfeng Ke and Jinsong Zhang and Yanlu Xie and Yanyan Xu and Binghuai Lin},
  journal= {arXiv preprint arXiv:2105.02509},
  year   = {2021}
}