PHASEN:一种相位与谐波感知的语音增强网络
声音
2019-11-13 v1 音频与语音处理
摘要
时频(T-F)域掩蔽是单通道语音增强的主流方法。近来,除幅度预测外,相位预测也受到关注。本文提出一种相位与谐波感知的深度神经网络(DNN),命名为PHASEN,用于该任务。与以往直接使用复理想比率掩蔽监督DNN学习的方法不同,我们设计了一个双流网络,其中幅度流与相位流分别致力于幅度与相位预测。我们发现两流之间应当相互通信,这对相位预测至关重要。此外,我们提出频率变换块以捕捉沿频率轴的远程相关性。可视化显示,所学变换矩阵自发地捕捉到谐波相关性,已被证明有助于T-F谱图重建。凭借这两项创新,PHASEN获得了处理精细相位模式及利用谐波模式的能力,在AVSpeech + AudioSet数据集上取得1.76dB SDR提升,且在该数据集上相较Google的网络获得显著增益。在Voice Bank + DEMAND数据集上,PHASEN在四项指标上大幅优于以往方法。
引用
@article{arxiv.1911.04697,
title = {PHASEN: A Phase-and-Harmonics-Aware Speech Enhancement Network},
author = {Dacheng Yin and Chong Luo and Zhiwei Xiong and Wenjun Zeng},
journal= {arXiv preprint arXiv:1911.04697},
year = {2019}
}
备注
Accepted by AAAI'20