基于RT-GCC-NMF的无监督低延迟语音增强
音频与语音处理
2019-04-08 v1 声音
摘要
本文提出RT-GCC-NMF:一种实时(RT)、双通道盲语音增强算法,它将非负矩阵分解(NMF)字典学习算法与广义互相关(GCC)空间定位方法相结合。利用预学习的通用NMF字典,RT-GCC-NMF以逐帧方式运行,根据估计的到达时间延迟(TDOA)将各个字典原子关联到目标语音或背景干扰。我们在语音与真实世界噪声的双通道混合数据上,基于信号分离评估活动(SiSEC)评估RT-GCC-NMF。我们证明该方法仅需极少训练数据即可泛化至新说话人、声学环境与录音设置,并且在总体感知评估音频源分离方法(PEASS)得分上优于SiSEC挑战赛中除一种外的所有算法,并与理想二值掩码基线相当。在广泛输入信噪比范围内,我们表明该方法同时改善了PEASS与基于信噪比(SNR)的盲源分离(BSS) Eval客观质量指标,以及短时客观可懂度(STOI)与扩展STOI(ESTOI)客观语音可懂度指标。NMF激活系数空间中的灵活软掩蔽函数提供了对干扰抑制与目标说话人保真度之间权衡的实时控制。最后,我们使用非对称短时傅里叶变换(STFT)将RT-GCC-NMF的固有算法延迟从64 ms降至2 ms且无性能损失。我们证明了在当前硬件平台上实现助听器可容忍延迟范围以内的延迟是可能的。
引用
@article{arxiv.1904.03130,
title = {Unsupervised Low Latency Speech Enhancement with RT-GCC-NMF},
author = {Sean U. N. Wood and Jean Rouat},
journal= {arXiv preprint arXiv:1904.03130},
year = {2019}
}
备注
Accepted for publication in the IEEE JSTSP Special Issue on Data Science: Machine Learning for Audio Signal Processing