AuralNet:基于分层注意力的重叠说话人三维双耳定位
音频与语音处理
2025-06-04 v1 声音
摘要
我们提出了 AuralNet,一种新颖的三维多源双耳声源定位方法,它可以在没有声源数量先验知识的情况下,在方位角和仰角上对重叠声源进行定位。AuralNet 采用门控的由粗到细架构,将粗分类阶段与细粒度回归阶段相结合,通过扇区划分实现灵活的空间分辨率。该模型结合多头自注意力机制以捕捉双耳信号中的空间线索,增强了在含噪-混响环境中的鲁棒性。设计了一种掩码多任务损失函数,用于联合优化声音检测、方位角和仰角估计。在含噪-混响条件下的广泛实验证明了 AuralNet 优于近期方法。
引用
@article{arxiv.2506.02773,
title = {AuralNet: Hierarchical Attention-based 3D Binaural Localization of Overlapping Speakers},
author = {Linya Fu and Yu Liu and Zhijie Liu and Zedong Yang and Zhong-Qiu Wang and Youfu Li and He Kong},
journal= {arXiv preprint arXiv:2506.02773},
year = {2025}
}
备注
Accepted and to appear at Interspeech 2025