使用混合时频域模型的双耳声源定位
声音
2024-02-07 v1 音频与语音处理
摘要
本文介绍了一种利用头相关传输函数(HRTF)特性的声源定位新方法,该方法能够从原始数据实现精确的全空间定位。以往的研究主要集中于在正面平面上使用大型麦克风阵列,但这种配置在处理较小麦克风阵列时往往在精度和鲁棒性方面存在局限。我们的模型提出同时使用时域和频域进行声源定位,并采用深度学习(DL)方法。我们提出的模型性能超越了当前最先进的结果。具体而言,其平均角度误差为0.24度,平均欧氏距离为0.01米,而已知最先进方法的平均角度误差为19.07度,平均欧氏距离为1.08米。这种精度水平对于广泛的应用至关重要,包括机器人技术、虚拟现实以及辅助人工耳蜗(CI)患者。
引用
@article{arxiv.2402.03867,
title = {Binaural sound source localization using a hybrid time and frequency domain model},
author = {Gil Geva and Olivier Warusfel and Shlomo Dubnov and Tammuz Dubnov and Amir Amedi and Yacov Hel-Or},
journal= {arXiv preprint arXiv:2402.03867},
year = {2024}
}