基于深度互相关的CNN声源定位中朝向域独立性的研究
信号处理
2020-06-11 v1
摘要
时延估计在声源定位(ASL)系统中至关重要。为此最常用技术之一是一对信号间的广义互相关(GCC)及其在导向响应功率(SRP)技术中的使用,后者估计特定位置的声功率。如今,深度学习策略可能优于这些方法。然而,它们通常依赖于训练阶段可用的几何与传感器配置条件,因此在面对新环境时若无重训练或自适应则泛化能力有限。在本工作中,我们提出一种基于编码器-解码器CNN架构的方法,能够在失配的训练-测试条件下无需模型重训练即超越著名的SRP-PHAT算法及其他深度学习策略。我们的方案旨在估计相关信号的平滑版本,随后用于生成精炼的声功率图,从而在ASL任务上获得更好性能。我们的实验评估使用了三个公开可用的真实数据集,并与SRP-PHAT算法及近期其他基于深度学习的方案进行了比较。
引用
@article{arxiv.2006.05447,
title = {Towards Domain Independence in CNN-based Acoustic Localization using Deep Cross Correlations},
author = {Juan Manuel Vera-Diaz and Daniel Pizarro and Javier Macias-Guarasa},
journal= {arXiv preprint arXiv:2006.05447},
year = {2020}
}