复用无混响预训练语音分离深度神经网络进行单源双耳去混响
音频与语音处理
2022-08-10 v1 声音
摘要
混响导致正常和听力受损听众的可懂度降低。本文提出了一种新颖的心理声学方法,通过复用预训练的双耳无混响语音分离神经网络对单一语音源进行去混响。由于训练深度神经网络(DNN)是一个漫长且计算昂贵的过程,使用预训练分离网络进行去混响的优势在于网络无需重新训练,节省了时间和计算资源。将混响源的耳间线索输入该预训练神经网络,以区分直达路径信号与混响语音。结果表明,与其他最先进的信号处理去混响算法相比,信号可懂度平均提高 1.3%,SRMR(信混比)提高 0.83 dB,语音质量感知评估(PESQ)提高 0.16 分;与基于机器学习的去混响算法正交匹配追踪结合谱减法(OSS)相比,可懂度提高 14%,质量提高 0.35 分。
引用
@article{arxiv.2208.04626,
title = {Recycling an anechoic pre-trained speech separation deep neural network for binaural dereverberation of a single source},
author = {Sania Gul and Muhammad Salman Khan and Syed Waqar Shah and Ata Ur-Rehman},
journal= {arXiv preprint arXiv:2208.04626},
year = {2022}
}
备注
15 pages, 4 figures