基于深度神经网络的语音增强的多目标学习与基于掩码的后处理
声音
2017-03-22 v1
摘要
我们提出一种多目标框架,用于学习既包含与语音增强(SE)预期任务不直接相关的辅助目标,也包含可直接用于构建增强语音信号的干净对数功率谱(LPS)特征这一主要目标。在基于深度神经网络(DNN)的语音增强中,我们引入一种辅助结构来学习辅助连续特征(如梅尔频率倒谱系数(MFCCs))和类别信息(如理想二值掩码(IBM)),并将其整合进原始DNN架构中以对所有参数进行联合优化。该联合估计方案施加了在LPS直接预测中不可用的额外约束,并有可能改善主要目标的学习。此外,作为副产品的所学辅助信息可用于其他目的,例如本工作中的基于IBM的后处理。一系列实验表明,联合LPS与MFCC学习提升了SE性能,且基于IBM的后处理进一步增强了重建语音的听感质量。
引用
@article{arxiv.1703.07172,
title = {Multi-Objective Learning and Mask-Based Post-Processing for Deep Neural Network Based Speech Enhancement},
author = {Yong Xu and Jun Du and Zhen Huang and Li-Rong Dai and Chin-Hui Lee},
journal= {arXiv preprint arXiv:1703.07172},
year = {2017}
}
备注
interspeech2015 paper, Germany