用于多通道语音增强的通道注意力稠密 U-Net
声音
2020-02-03 v1 机器学习
音频与语音处理
机器学习
摘要
近来,有监督深度学习在语音增强中受到极大关注。最先进的深度学习方法通过学习一个比率/二值掩码来完成任务,该掩码在时频域应用于混合信号以产生干净语音。尽管在单通道设置下性能优异,这些框架在多通道设置下性能滞后,因为大多数方法 a) 未能充分利用可用的空间信息,且 b) 仍将深度架构视为黑箱,可能并不适合多通道音频处理。本文针对这些缺陷,a) 利用复比率掩码替代对谱图幅度的掩码,更重要的是 b) 通过在深度架构内引入通道注意力机制来模拟波束成形。我们提出通道注意力稠密 U-Net,其中我们在网络每一层的特征图上递归地应用通道注意力单元,使网络能够执行非线性波束成形。我们在 CHiME-3 数据集上展示了该网络相对于最先进方法的优越性能。
引用
@article{arxiv.2001.11542,
title = {Channel-Attention Dense U-Net for Multichannel Speech Enhancement},
author = {Bahareh Tolooshams and Ritwik Giri and Andrew H. Song and Umut Isik and Arvindh Krishnaswamy},
journal= {arXiv preprint arXiv:2001.11542},
year = {2020}
}