中文

基于深度神经网络与非对称分析-合成窗对的低延迟语音分离

音频与语音处理 2021-06-23 v1 声音

摘要

基于低延迟深度神经网络(DNN)的源分离通常采用通过短对称窗计算的时频掩蔽或谱预测。本文提出使用非对称分析-合成窗对,其允许以具有更佳频率分辨率的靶标进行训练,同时在推理时保持适用于实时语音增强或助听应用的低延迟。为跨多种模型类型与数据集评估我们的方法,我们使用独立于说话人的深度聚类(DC)模型与依赖于说话人的掩蔽推断(MI)模型进行评测。我们报告了在保持8 ms算法延迟的同时,源失真比(SDR)方面分离性能最高提升1.5 dB。

关键词

引用

@article{arxiv.2106.11794,
  title  = {Deep neural network Based Low-latency Speech Separation with Asymmetric analysis-Synthesis Window Pair},
  author = {Shanshan Wang and Gaurav Naithani and Archontis Politis and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2106.11794},
  year   = {2021}
}

备注

Accepted to EUSIPCO-2021