基于感知驱动黑盒代价函数的DNN语音增强稳定训练
音频与语音处理
2020-02-17 v1 机器学习
声音
机器学习
摘要
提升增强信号的主观音质是语音增强中最重要的任务之一。为评估主观质量,已提出若干与感知驱动客观音质评估(OSQA)相关的方法,如PESQ(语音质量感知评估)。然而,此类度量在大多数情况下不能直接用于训练深度神经网络(DNN),因为流行的OSQA相对于DNN参数是不可微的。因此,先前研究提出用一个辅助DNN来近似OSQA的分数,从而利用其梯度训练主DNN。该方法的一个问题是因分数近似误差导致的训练不稳定。为克服此问题,我们提出借用强化学习中的稳定化技术。以提升PESQ分数为目标的实验表明,所提方法(i)能稳定训练DNN以提升PESQ,(ii)在公开数据集上取得了最先进的PESQ分数,且(iii)基于主观评估获得了优于传统方法的音质。
引用
@article{arxiv.2002.05879,
title = {Stable Training of DNN for Speech Enhancement based on Perceptually-Motivated Black-Box Cost Function},
author = {Masaki Kawanaka and Yuma Koizumi and Ryoichi Miyazaki and Kohei Yatabe},
journal= {arXiv preprint arXiv:2002.05879},
year = {2020}
}
备注
accepted to the 45th International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2020)