中文

基于深度学习的大型自组织麦克风阵列分级二维说话人定位

音频与语音处理 2024-04-02 v2 声音

摘要

尽管基于深度学习的说话人定位在复杂声学环境中已展现出优势,但其通常仅能提供到达方向(DOA)线索而非精确的二维(2D)坐标。为此,我们提出了一种利用自组织麦克风阵列的基于深度学习的新型二维说话人定位方法,其中自组织麦克风阵列由随机分布的麦克风节点组成,每个节点均配备传统阵列。具体而言,我们首先在各节点使用卷积神经网络估计说话人方向,随后通过三角测量与聚类技术整合这些DOA估计以获得说话人二维位置。为进一步提升估计精度,我们引入了一种节点选择算法,策略性地筛选最可靠的节点。在仿真与真实数据上的大量实验表明,我们的方法显著优于传统方法,所提出的节点选择进一步精炼了性能。实验中使用的真实数据集名为Libri-adhoc-node10,系本文首次描述的新录制数据,已于 https://github.com/Liu-sp/Libri-adhoc-nodes10 在线发布。

关键词

引用

@article{arxiv.2210.10265,
  title  = {Deep Learning Based Stage-wise Two-dimensional Speaker Localization with Large Ad-hoc Microphone Arrays},
  author = {Shupei Liu and Linfeng Feng and Yijun Gong and Chengdong Liang and Chen Zhang and Xiao-Lei Zhang and Xuelong Li},
  journal= {arXiv preprint arXiv:2210.10265},
  year   = {2024}
}