中文

利用生成对抗网络进行多指标优化以提升近端语音可懂度

音频与语音处理 2021-09-17 v2 声音

摘要

在环境噪声与混响存在下,语音可懂度严重退化。本文中,我们提出一种基于深度学习的新颖系统,用于在等功率约束下(即修改前后信号功率必须相同)修改语音信号以提升其可懂度。为此,我们利用生成对抗网络(GANs)获得时频相关放大因子,随后将其应用于输入原始语音以重分配语音能量。我们并非仅优化单一简单指标,而是训练深度神经网络(DNN)模型同时优化多个先进语音指标(包括可懂度相关与质量相关者),从而带来性能与鲁棒性的显著提升。我们的系统不仅能以非实时模式工作于离线音频播放,也支持实用实时语音应用。采用客观测量与主观试听的实验结果表明,所提系统在各种噪声与混响聆听条件下显著优于最先进的基线系统。

关键词

引用

@article{arxiv.2104.08499,
  title  = {Multi-Metric Optimization using Generative Adversarial Networks for Near-End Speech Intelligibility Enhancement},
  author = {Haoyu Li and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2104.08499},
  year   = {2021}
}

备注

Accepted to IEEE/ACM Transactions on Audio Speech and Language Processing