面向基于 DNN 的声源增强的完美重构滤波器组的数据驱动设计
音频与语音处理
2019-03-22 v1 声音
摘要
我们提出一种基于深度神经网络(DNN)的声源增强(SSE)的完美重构滤波器组(PRFB)数据驱动设计方法。DNN 已被用于在短时傅里叶变换(STFT)域估计时频(T-F)掩码。与使用诸如客观音质评估等高级代价相比,当采用均方误差(MSE)等简单代价函数时,其训练更为稳定。然而,此类简单代价函数对目标与/或噪声的统计特性继承了强假设,而这些假设常不满足,假设失配会导致性能下降。本文中,我们提出从训练数据设计 PRFB 的频率尺度,以使 MSE 的假设得以满足。为设计频率尺度,将翘曲滤波器组框架(WFBF)视为 PRFB。所学 WFBF 的频率特性介于 STFT 与小波变换之间,并且通过与以 mel 尺度压缩输入特征的标准基于 STFT 的 DNN 比较,确认了其有效性。
引用
@article{arxiv.1903.08876,
title = {Data-driven design of perfect reconstruction filterbank for DNN-based sound source enhancement},
author = {Daiki Takeuchi and Kohei Yatabe and Yuma Koizumi and Yasuhiro Oikawa and Noboru Harada},
journal= {arXiv preprint arXiv:1903.08876},
year = {2019}
}
备注
5 pages, to appear in IEEE ICASSP 2019 (Paper Code: AASP-P8.8, Session: Spatial Audio, Audio Enhancement and Bandwidth Extension)