中文

基于深度嵌入特征的多通道语音分离空间与频谱深度注意力融合

音频与语音处理 2020-02-06 v1 机器学习 声音

摘要

多通道深度聚类(MDC)在语音分离中已取得良好性能。然而,MDC仅将空间特征作为附加信息,难以学习空间与频谱特征间的相互关系。此外,MDC的训练目标定义于嵌入向量而非真实分离源,可能损害分离性能。本工作中,我们提出一种深度注意力融合方法,动态控制频谱与空间特征的权重并深度结合二者。此外,为解决MDC的训练目标问题,采用真实分离源作为训练目标。具体而言,我们应用深度聚类网络提取深度嵌入特征;不同于使用无监督K-means聚类估计二值掩码,另用一监督网络从这些深度嵌入特征中学习软掩码。实验在WSJ0-2mix数据集的空间化混响版本上进行,结果表明所提方法优于MDC基线,甚至好于预言理想二值掩码(IBM)。

关键词

引用

@article{arxiv.2002.01626,
  title  = {Spatial and spectral deep attention fusion for multi-channel speech separation using deep embedding features},
  author = {Cunhang Fan and Bin Liu and Jianhua Tao and Jiangyan Yi and Zhengqi Wen},
  journal= {arXiv preprint arXiv:2002.01626},
  year   = {2020}
}