中文

用于多通道语音增强的通道注意力稠密 U-Net

声音 2020-02-03 v1 机器学习 音频与语音处理 机器学习

摘要

近来,有监督深度学习在语音增强中受到极大关注。最先进的深度学习方法通过学习一个比率/二值掩码来完成任务,该掩码在时频域应用于混合信号以产生干净语音。尽管在单通道设置下性能优异,这些框架在多通道设置下性能滞后,因为大多数方法 a) 未能充分利用可用的空间信息,且 b) 仍将深度架构视为黑箱,可能并不适合多通道音频处理。本文针对这些缺陷,a) 利用复比率掩码替代对谱图幅度的掩码,更重要的是 b) 通过在深度架构内引入通道注意力机制来模拟波束成形。我们提出通道注意力稠密 U-Net,其中我们在网络每一层的特征图上递归地应用通道注意力单元,使网络能够执行非线性波束成形。我们在 CHiME-3 数据集上展示了该网络相对于最先进方法的优越性能。

关键词

引用

@article{arxiv.2001.11542,
  title  = {Channel-Attention Dense U-Net for Multichannel Speech Enhancement},
  author = {Bahareh Tolooshams and Ritwik Giri and Andrew H. Song and Umut Isik and Arvindh Krishnaswamy},
  journal= {arXiv preprint arXiv:2001.11542},
  year   = {2020}
}