中文

用于从干净语音仿真带噪语音的GAN研究

声音 2023-05-23 v1 音频与语音处理

摘要

在干净语音上训练的语音处理模型在噪声条件下的性能显著下降。使用噪声数据集训练可缓解该问题,但获取此类数据集并非总是可行。从干净语音生成噪声语音的带噪语音仿真模型有助于补救这一问题。在我们的工作中,我们研究了生成对抗网络(GANs)仿真多种噪声的能力。研究了来自特高频/甚高频(UHF/VHF)、加性平稳与非平稳以及编解码失真的噪声类别。我们提出了四种GAN,包括非平行翻译器SpeechAttentionGAN、SimuGAN和MaskCycleGAN-Augment,以及平行翻译器Speech2Speech-Augment。在约3分钟的小数据集上训练后,相较于基线,我们在RATS、TIMIT-Cabin和TIMIT-Helicopter数据集上分别实现了以多尺度谱损失(MSSL)衡量的55.8%、28.9%和22.8%的提升。

关键词

引用

@article{arxiv.2305.12460,
  title  = {Study of GANs for Noisy Speech Simulation from Clean Speech},
  author = {Leander Melroy Maben and Zixun Guo and Chen Chen and Utkarsh Chudiwal and Chng Eng Siong},
  journal= {arXiv preprint arXiv:2305.12460},
  year   = {2023}
}