中文

SEGAN:语音增强生成对抗网络

机器学习 2017-06-12 v3 神经与进化计算 声音

摘要

当前的语音增强技术在频谱域上运行和/或利用一些高层特征。它们中的大多数处理有限数量的噪声条件,并依赖于一阶统计量。为了规避这些问题,深度网络正被越来越多地使用,这得益于它们从大量样本集中学习复杂函数的能力。在这项工作中,我们提出将生成对抗网络用于语音增强。与现有技术相比,我们在波形层面操作,端到端地训练模型,并将 28 个说话人和 40 种不同的噪声条件纳入同一模型中,使得模型参数在它们之间共享。我们使用包含两个说话人和 20 种替代噪声条件的独立、未见测试集来评估所提出的模型。增强后的样本证实了所提出模型的可行性,客观和主观评估均证实了其有效性。借此,我们开启了对用于语音增强的生成式架构的探索,这些架构可能会逐步引入更多以语音为中心的设计选择以提升其性能。

关键词

引用

@article{arxiv.1703.09452,
  title  = {SEGAN: Speech Enhancement Generative Adversarial Network},
  author = {Santiago Pascual and Antonio Bonafonte and Joan Serrà},
  journal= {arXiv preprint arXiv:1703.09452},
  year   = {2017}
}

备注

5 pages, 4 figures, accepted in INTERSPEECH 2017