中文

基于端到端后滤波方法与深度注意力融合特征的语音分离

音频与语音处理 2020-03-18 v1 多媒体 声音

摘要

本文提出一种采用深度注意力融合特征的端到端后滤波方法,用于单通道说话人无关的语音分离。首先,应用时频域语音分离方法作为预分离阶段,其目标是初步分离混合语音。尽管该阶段可分离混合信号,但仍包含残留干扰。为了进一步增强预分离语音并提升分离性能,提出了带有深度注意力融合特征的端到端后滤波器(E2EPF)。E2EPF 可充分利用预分离语音的先验知识,有助于语音分离。它是一个全卷积语音分离网络,并以波形作为输入特征。首先,利用一维卷积层在时域为混合信号与预分离信号提取深度表征特征。其次,为更关注预分离阶段的输出,应用注意力模块获取深度注意力融合特征,其通过计算混合语音与预分离语音之间的相似度提取得到。这些深度注意力融合特征有助于降低干扰并增强预分离语音。最后,将这些特征送入后滤波器以估计各目标信号。在 WSJ0-2mix 数据集上的实验结果表明,所提方法优于当前最优的语音分离方法。与预分离方法相比,我们的方法在尺度不变信噪比(SI-SNR)、信号失真比(SDR)、语音质量感知评估(PESQ)和短时客观可懂度(STOI)指标上分别获得了 64.1%、60.2%、25.6% 和 7.5% 的相对提升。

关键词

引用

@article{arxiv.2003.07544,
  title  = {Deep Attention Fusion Feature for Speech Separation with End-to-End Post-filter Method},
  author = {Cunhang Fan and Jianhua Tao and Bin Liu and Jiangyan Yi and Zhengqi Wen and Xuefei Liu},
  journal= {arXiv preprint arXiv:2003.07544},
  year   = {2020}
}

备注

ACCEPTED by IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)