基于深度神经网络与非对称分析-合成窗对的低延迟语音分离
音频与语音处理
2021-06-23 v1 声音
摘要
基于低延迟深度神经网络(DNN)的源分离通常采用通过短对称窗计算的时频掩蔽或谱预测。本文提出使用非对称分析-合成窗对,其允许以具有更佳频率分辨率的靶标进行训练,同时在推理时保持适用于实时语音增强或助听应用的低延迟。为跨多种模型类型与数据集评估我们的方法,我们使用独立于说话人的深度聚类(DC)模型与依赖于说话人的掩蔽推断(MI)模型进行评测。我们报告了在保持8 ms算法延迟的同时,源失真比(SDR)方面分离性能最高提升1.5 dB。
引用
@article{arxiv.2106.11794,
title = {Deep neural network Based Low-latency Speech Separation with Asymmetric analysis-Synthesis Window Pair},
author = {Shanshan Wang and Gaurav Naithani and Archontis Politis and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2106.11794},
year = {2021}
}
备注
Accepted to EUSIPCO-2021