中文

使用逐层相关性传播解释端到端语音声源定位深度学习模型

音频与语音处理 2024-04-29 v2 声音

摘要

深度学习模型广泛应用于信号处理领域,但其内部工作过程通常被视为黑盒。本文研究了可解释人工智能(XAI)技术在基于学习的端到端语音声源定位模型中的应用。我们考虑了逐层相关性传播(LRP)技术,旨在确定输入的哪些部分对输出预测更为重要。我们使用LRP分析了两个架构复杂度不同的SOTA模型,它们将麦克风采集的音频信号映射为声源的笛卡尔坐标。具体而言,我们检查了这两个模型输入特征的相关性,发现两个网络都会对麦克风信号进行降噪和去混响处理,以计算它们之间更准确的统计相关性,从而定位声源。为了进一步证明这一事实,我们分别使用麦克风信号和从这两个网络中提取的相关性信号,通过带相位变换的广义互相关(GCC-PHAT)估计到达时间差(TDoAs),并表明通过后者我们获得了更准确的时延估计结果。

关键词

引用

@article{arxiv.2404.03436,
  title  = {Interpreting End-to-End Deep Learning Models for Speech Source Localization Using Layer-wise Relevance Propagation},
  author = {Luca Comanducci and Fabio Antonacci and Augusto Sarti},
  journal= {arXiv preprint arXiv:2404.03436},
  year   = {2024}
}