中文

基于多度量学习的卷积神经网络复频谱图增强

机器学习 2017-09-12 v2 机器学习 声音

摘要

本文旨在解决当前语音增强方法中存在的两个问题:1) 相位估计的困难;2) 单一目标函数无法同时考虑多个度量。为解决第一个问题,我们提出了一种用于复频谱图增强的新型卷积神经网络(CNN)模型,即从带噪频谱图估计干净的实数和虚数(RI)频谱图。重构的RI频谱图直接用于合成增强的语音波形。此外,由于对数功率频谱图(LPS)可表示为RI频谱图的函数,其重构也被视为另一个目标。因此,结合这两个目标(RI频谱图重构与LPS重构)的统一目标函数,等价于同时优化两个常用客观度量:分段信噪比(SSNR)和对数谱失真(LSD)。由此,该学习过程被称为多度量学习(MML)。实验结果证实了所提出的带有RI频谱图和MML的CNN在语音增强任务上标准化评估度量改善方面的有效性。

关键词

引用

@article{arxiv.1704.08504,
  title  = {Complex spectrogram enhancement by convolutional neural network with multi-metrics learning},
  author = {Szu-Wei Fu and Ting-yao Hu and Yu Tsao and Xugang Lu},
  journal= {arXiv preprint arXiv:1704.08504},
  year   = {2017}
}