中文

利用改进的 SEGAN 模型将低质量设备录音语音转换为高质量语音

声音 2019-11-21 v2 音频与语音处理

摘要

如今,大量语音数据由智能手机、平板电脑、笔记本电脑和中质量麦克风等低质量录音设备录制。本研究的目标是探究此类低质量设备录音语音的自动高质量生成方法,并可应用于诸多语音生成任务。本文首先介绍我们新的设备录音语音数据集,随后提出一种改进端到端方法,用于自动将低质量设备录音语音转换为专业高质量语音。我们的方法基于生成对抗网络(GAN)的语音增强模型——语音增强 GAN(SEGAN)的扩展,并给出两处修改以使模型训练更鲁棒和稳定。最后,通过大规模听测,我们表明所提方法能显著提升设备录音语音信号的质量。

关键词

引用

@article{arxiv.1911.03952,
  title  = {Transformation of low-quality device-recorded speech to high-quality speech using improved SEGAN model},
  author = {Seyyed Saeed Sarfjoo and Xin Wang and Gustav Eje Henter and Jaime Lorenzo-Trueba and Shinji Takaki and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:1911.03952},
  year   = {2019}
}

备注

This study was conducted during an internship of the first author at NII, Japan in 2017