基于 DNN 的源增强以提升客观音质评估分数
机器学习
2018-10-23 v1 机器学习
声音
音频与语音处理
摘要
我们提出一种基于深度神经网络(DNN)的源增强训练方法,以提升客观音质评估(OSQA)分数,例如语音质量感知评估(PESQ)。在许多传统研究中,DNN 被用作估计时频掩码的映射函数,并训练以最小化可解析处理的客观函数,如均方误差(MSE)。由于 OSQA 分数已被广泛用于音质评估,构建旨在提升 OSQA 分数的 DNN 比使用最小 MSE 来生成高质量输出信号更好。然而,由于大多数 OSQA 分数不可解析处理,即它们是黑箱,因此无法通过简单应用反向传播计算客观函数的梯度。为计算基于 OSQA 的客观函数的梯度,我们基于黑箱优化制定了 DNN 优化方案,该方案用于训练玩游戏的程序。对于黑箱优化方案,我们采用策略梯度法基于采样算法计算梯度。为使用采样算法模拟输出信号,DNN 被用于估计最大化 OSQA 分数的输出信号的概率密度函数。根据模拟输出信号计算 OSQA 分数,并训练 DNN 以增加生成具有高 OSQA 分数的模拟输出信号的概率。通过若干实验,我们发现即使 MSE 未被最小化,应用所提方法仍使 OSQA 分数显著提升。
引用
@article{arxiv.1810.09137,
title = {DNN-based Source Enhancement to Increase Objective Sound Quality Assessment Score},
author = {Yuma Koizumi and Kenta Niwa and Yusuke Hioka and Kazunori Kobayashi and Yoichi Haneda},
journal= {arXiv preprint arXiv:1810.09137},
year = {2018}
}