基于深度神经网络的立体声感知语音增强训练框架
音频与语音处理
2022-02-02 v2 机器学习
声音
摘要
近年来,基于深度学习的语音增强取得了前所未有的性能。最流行的单声道语音增强框架是端到端网络,将带噪混合映射为干净语音的估计。随着计算能力的增长和多通道麦克风录音的普及,已有工作旨在结合空间统计信息与频谱信息以提升性能。尽管单声道输出的增强性能有所改善,但空间声像保持与主观评价在文献中未受到太多关注。本文提出了一种新颖的立体声感知语音增强框架,即一种用于基于深度学习的语音增强的训练损失,以在增强立体声混合的同时保持空间声像。所提框架与模型无关,因此可应用于任何基于深度学习的架构。我们通过听测对训练模型进行了广泛的客观与主观评价。我们表明,通过对声像保持损失进行正则化,整体性能得到提升,且语音的立体声特性被更好地保留。
引用
@article{arxiv.2112.04939,
title = {A Training Framework for Stereo-Aware Speech Enhancement using Deep Neural Networks},
author = {Bahareh Tolooshams and Kazuhito Koishida},
journal= {arXiv preprint arXiv:2112.04939},
year = {2022}
}
备注
Accepted to the IEEE 47th International Conference on Acoustics, Speech, and Signal Processing (ICASSP)