基于自监督方法的声学映射方向到达估计
声音
2025-07-10 v1 人工智能
音频与语音处理
摘要
声学映射技术长期用于空间音频处理中的方向到达估计(DoAE)。传统的波束成形方法虽然可解释,但往往依赖于计算密集且对声学波动性敏感的迭代求解器。另一方面,近期的监督式深度学习方法提供了前馈速度和鲁棒性,但需要大量标注数据且缺乏可解释性。尽管两者各有优势,但在不同声学环境和阵列配置下难以一致泛化,限制了更广泛的适用性。我们引入 Latent Acoustic Mapping(LAM)模型,一种自监督框架,旨在弥合传统方法的可解释性与深度学习方法的适应性和效率之间的鸿沟。LAM 生成高分辨率声学图,适应各种声学条件,在不同麦克风阵列间高效运行。我们在 DoAE 上使用 LOCATA 和 STARSS 基准测试评估了其鲁棒性。LAM 在定位性能方面达到或优于现有监督方法。此外,我们展示了 LAM 的声学图可作为监督模型的有效特征,进一步提高 DoAE 精度,凸显其在自适应高性能声定位系统中的潜力。
引用
@article{arxiv.2507.07066,
title = {Latent Acoustic Mapping for Direction of Arrival Estimation: A Self-Supervised Approach},
author = {Adrian S. Roman and Iran R. Roman and Juan P. Bello},
journal= {arXiv preprint arXiv:2507.07066},
year = {2025}
}