利用生成对抗网络进行多指标优化以提升近端语音可懂度
音频与语音处理
2021-09-17 v2 声音
摘要
在环境噪声与混响存在下,语音可懂度严重退化。本文中,我们提出一种基于深度学习的新颖系统,用于在等功率约束下(即修改前后信号功率必须相同)修改语音信号以提升其可懂度。为此,我们利用生成对抗网络(GANs)获得时频相关放大因子,随后将其应用于输入原始语音以重分配语音能量。我们并非仅优化单一简单指标,而是训练深度神经网络(DNN)模型同时优化多个先进语音指标(包括可懂度相关与质量相关者),从而带来性能与鲁棒性的显著提升。我们的系统不仅能以非实时模式工作于离线音频播放,也支持实用实时语音应用。采用客观测量与主观试听的实验结果表明,所提系统在各种噪声与混响聆听条件下显著优于最先进的基线系统。
引用
@article{arxiv.2104.08499,
title = {Multi-Metric Optimization using Generative Adversarial Networks for Near-End Speech Intelligibility Enhancement},
author = {Haoyu Li and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2104.08499},
year = {2021}
}
备注
Accepted to IEEE/ACM Transactions on Audio Speech and Language Processing