基于残差U-Net的声学回声消除
音频与语音处理
2021-09-21 v1 机器学习
摘要
本文提出了一种基于U-Net卷积神经网络的声学回声消除器,适用于单讲与双讲场景。U-Net网络因其能够再现音频信号最细微的细节,此前已用于音频处理领域的源分离问题,但据我们所知,这是其首次用于声学回声消除(AEC)。U-Net超参数已优化以获得最佳AEC性能,同时采用较少的参数数量以满足40 ms的延迟限制。我们的模型训练和测试在微软组织的“ICASSP 2021 AEC Challenge”框架内进行。我们使用仅合成数据集(S-U-Net)以及合成数据集与真实数据集的单讲集(SR-U-Net)训练了优化后的U-Net模型,这两个数据集均为该挑战赛发布。S-U-Net模型在双讲场景中表现更好,因此其从盲测试集推断的近端信号被提交至挑战赛。我们的消除器在17支队伍中排名第12,在10支学术队伍中排名第5,总体平均意见得分达3.57。
引用
@article{arxiv.2109.09686,
title = {Acoustic Echo Cancellation using Residual U-Nets},
author = {J. Silva-Rodríguez and M. F. Dolz and M. Ferrer and A. Castelló and V. Naranjo and G. Piñero},
journal= {arXiv preprint arXiv:2109.09686},
year = {2021}
}
备注
6 pages, 2 figures, submitted to the 2021 IEEE International Conference on Acoustics, Speech and Signal Processing on October 2020