改进用于语音增强的 GAN
机器学习
2020-10-28 v3 声音
音频与语音处理
机器学习
摘要
生成对抗网络(GAN)近来已被证明在语音增强方面是高效的。然而,现有语音增强 GAN(SEGAN)即便不是全部,也大多使用单一生成器来执行单阶段增强映射。在本工作中,我们提出使用多个串联的生成器来执行多阶段增强映射,以阶段式的方式逐步精炼带噪输入信号。此外,我们研究了两种情形:(1)生成器共享参数;(2)生成器参数相互独立。前者约束生成器学习一个共同的映射,并在所有增强阶段迭代应用,从而导致较小的模型占用。相反,后者允许生成器在网络的不同阶段灵活学习不同的增强映射,代价是模型尺寸增大。我们证明,所提出的多阶段增强方法优于单阶段 SEGAN 基线,其中独立生成器比参数绑定生成器带来更有利的结果。源代码可在 http://github.com/pquochuy/idsegan 获取。
引用
@article{arxiv.2001.05532,
title = {Improving GANs for Speech Enhancement},
author = {Huy Phan and Ian V. McLoughlin and Lam Pham and Oliver Y. Chén and Philipp Koch and Maarten De Vos and Alfred Mertins},
journal= {arXiv preprint arXiv:2001.05532},
year = {2020}
}
备注
This letter has been accepted for publication in IEEE Signal Processing Letters