中文

基于自组织麦克风阵列的端到端二维声源定位

音频与语音处理 2022-10-18 v1 声音

摘要

传统的声源定位方法大多基于由多个麦克风组成的单一麦克风阵列,通常被表述为到达方向估计问题。本文提出一种基于深度学习的、使用自组织(ad-hoc)麦克风阵列的端到端声源定位方法,其中自组织麦克风阵列是一组随机分布且相互协作的麦克风阵列。它仅利用每个节点一个麦克风即可产生说话人的二维位置。具体而言,我们将目标室内空间划分为多个局部区域,用one-hot编码表示每个局部区域,从而节点与说话人位置均可由one-hot编码表示。相应地,声源定位问题被表述为:给定麦克风节点的one-hot编码及其语音录音,识别说话人one-hot编码的分类任务。我们为该分类问题设计了一个端到端时空深度模型,其采用时空注意力架构并在架构中间插入融合层,能够在模型训练与测试时处理任意不同数量的麦克风节点。实验结果表明,所提方法在高混响与噪声环境下取得了良好性能。

关键词

引用

@article{arxiv.2210.08484,
  title  = {End-to-end Two-dimensional Sound Source Localization With Ad-hoc Microphone Arrays},
  author = {Yijun Gong and Shupei Liu and Xiao-Lei Zhang},
  journal= {arXiv preprint arXiv:2210.08484},
  year   = {2022}
}

备注

6 pages, 4 figures, coference