中文

用于语音增强的自注意力生成对抗网络

声音 2021-02-09 v3 机器学习 音频与语音处理

摘要

现有的用于语音增强的生成对抗网络(GANs)仅依赖卷积操作,这可能模糊序列输入间的时间依赖关系。为补救此问题,我们提出一个改编自非局部注意力的自注意力层,并将其与采用原始信号输入的语音增强 GAN(SEGAN)的卷积和反卷积层相结合。此外,我们实证研究了在内存允许时将自注意力层置于(反)卷积层不同层索引处以及置于所有层处的效果。我们的实验表明,将自注意力引入 SEGAN 在增强性能的 objective 评测指标上带来了一致的提升。而且,应用于不同的(反)卷积层并不会显著改变性能,这表明它可方便地应用于具有最小内存开销的最高层(反)卷积层。

关键词

引用

@article{arxiv.2010.09132,
  title  = {Self-Attention Generative Adversarial Network for Speech Enhancement},
  author = {Huy Phan and Huy Le Nguyen and Oliver Y. Chén and Philipp Koch and Ngoc Q. K. Duong and Ian McLoughlin and Alfred Mertins},
  journal= {arXiv preprint arXiv:2010.09132},
  year   = {2021}
}

备注

46th IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2021). Source code is available at http://github.com/pquochuy/sasegan