MetricGAN+:一种改进版MetricGAN用于语音增强
声音
2021-06-07 v2 人工智能
音频与语音处理
摘要
用于训练语音增强模型的代价函数与人类听觉感知之间的差异通常使得增强语音的质量不尽如人意。因此,考虑人类感知的客观评价指标可作为缩小这一差距的桥梁。我们之前提出的MetricGAN旨在通过将该指标与判别器相连来优化客观指标。由于训练期间仅需要目标评价函数的分数,这些指标甚至可以是不可微的。在本研究中,我们提出了一种MetricGAN+,其中引入了三种结合语音处理领域知识的训练技术。利用这些技术,在VoiceBank-DEMAND数据集上的实验结果表明,与之前的MetricGAN相比,MetricGAN+可将PESQ分数提高0.3,并取得最先进的结果(PESQ分数=3.15)。
引用
@article{arxiv.2104.03538,
title = {MetricGAN+: An Improved Version of MetricGAN for Speech Enhancement},
author = {Szu-Wei Fu and Cheng Yu and Tsun-An Hsieh and Peter Plantinga and Mirco Ravanelli and Xugang Lu and Yu Tsao},
journal= {arXiv preprint arXiv:2104.03538},
year = {2021}
}
备注
Accepted by Interspeech 2021