中文

双耳声源定位时频特征的系统评估

音频与语音处理 2025-11-19 v2 机器学习 声音

摘要

本研究对双耳声源定位(SSL)的时频特征设计进行系统评估,重点关注特征选择如何影响不同条件下的模型性能。我们检验了基于卷积神经网络(CNN)模型的各种幅度特征(幅度谱图、双耳水平差 - ILD)和相位特征(相位谱图、双耳相位差 - IPD)的性能。对原域内外数据以及不匹配的头部相关传递函数(HRTF)数据进行评估,发现仔细选择的特征组合往往优于模型复杂度的增加。虽然如 ILD + IPD 这样的两特征集合对原域 SSL 已足够,但针对多样化内容的泛化化需要更丰富的输入,将信道谱图与两种 ILD 和 IPD 结合。使用最优特征集合,我们的低复杂度 CNN 模型实现了竞争性能。我们的发现凸显了特征设计在双耳 SSL 中的重要性,并为面向特定领域和通用定位提供了实用指导。

关键词

引用

@article{arxiv.2511.13487,
  title  = {Systematic Evaluation of Time-Frequency Features for Binaural Sound Source Localization},
  author = {Davoud Shariat Panah and Alessandro Ragano and Dan Barry and Jan Skoglund and Andrew Hines},
  journal= {arXiv preprint arXiv:2511.13487},
  year   = {2025}
}

备注

Submitted to ICASSP 2026