中文

在基于神经网络的语音增强系统中引入真实世界含噪语音

音频与语音处理 2021-09-22 v2 声音

摘要

有监督语音增强在训练时依赖于退化语音信号与其干净参考信号的并行数据库。这一设定禁止使用能更好代表此类系统实际使用场景的真实世界退化语音数据。本文中,我们探索使有监督语音增强系统能够用真实世界退化语音数据训练的方法。具体而言,我们提出一种用于语音增强的半监督方法:首先训练一个求解源分离任务的改进向量量化变分自编码器;随后利用该训练好的自编码器,通过计算出基于三元组的无监督损失函数,使用真实世界含噪语音数据进一步训练增强网络。实验显示了在语音增强系统训练中加入真实世界数据的良好前景。

关键词

引用

@article{arxiv.2109.05172,
  title  = {Incorporating Real-world Noisy Speech in Neural-network-based Speech Enhancement Systems},
  author = {Yangyang Xia and Buye Xu and Anurag Kumar},
  journal= {arXiv preprint arXiv:2109.05172},
  year   = {2021}
}