用于语音增强的自注意力生成对抗网络
声音
2021-02-09 v3 机器学习
音频与语音处理
摘要
现有的用于语音增强的生成对抗网络(GANs)仅依赖卷积操作,这可能模糊序列输入间的时间依赖关系。为补救此问题,我们提出一个改编自非局部注意力的自注意力层,并将其与采用原始信号输入的语音增强 GAN(SEGAN)的卷积和反卷积层相结合。此外,我们实证研究了在内存允许时将自注意力层置于(反)卷积层不同层索引处以及置于所有层处的效果。我们的实验表明,将自注意力引入 SEGAN 在增强性能的 objective 评测指标上带来了一致的提升。而且,应用于不同的(反)卷积层并不会显著改变性能,这表明它可方便地应用于具有最小内存开销的最高层(反)卷积层。
引用
@article{arxiv.2010.09132,
title = {Self-Attention Generative Adversarial Network for Speech Enhancement},
author = {Huy Phan and Huy Le Nguyen and Oliver Y. Chén and Philipp Koch and Ngoc Q. K. Duong and Ian McLoughlin and Alfred Mertins},
journal= {arXiv preprint arXiv:2010.09132},
year = {2021}
}
备注
46th IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2021). Source code is available at http://github.com/pquochuy/sasegan