面向广义语音增强的生成对抗网络方法
声音
2019-04-09 v1 机器学习
音频与语音处理
摘要
语音增强任务通常包含去除部分掩蔽语音语句、影响其可懂度的加性噪声或混响。然而,其他或许更具侵略性的信号失真,如削波、块消除或频带去除,鲜受关注。此类失真不仅严重影响可懂度,亦影响自然度甚至说话人身份,需细致信号重建。本工作中,我们充分考量此广义语音增强任务,并展示其可由时域生成对抗网络(GAN)应对。具体而言,我们扩展先前的基于GAN语音增强系统以处理四类侵略性失真混合。首先,我们提出增加对抗声学回归损失,以促进判别器处更丰富的特征提取。其次,我们采用两步对抗训练调度,作为预热与微调序列。客观与主观评测均表明,这两处改进带来了更优语音重建,能更好匹配原说话人身份与自然度。
引用
@article{arxiv.1904.03418,
title = {Towards Generalized Speech Enhancement with Generative Adversarial Networks},
author = {Santiago Pascual and Joan Serrà and Antonio Bonafonte},
journal= {arXiv preprint arXiv:1904.03418},
year = {2019}
}