LuSeeL:基于语言查询的双耳通用声音事件提取与定位
音频与语音处理
2026-01-28 v1
摘要
大多数通用声音提取算法侧重于从单通道音频混合中分离出目标声音事件。然而,现实世界是三维的,模拟人类听觉的双耳音频可以捕获更丰富的空间信息,包括声源位置。这种空间上下文对于理解和建模复杂的听觉场景至关重要,因为它本质上为声音检测和提取提供了信息。在这项工作中,我们提出了一种语言驱动的通用声音提取网络,通过有效利用双耳信号中存在的空间线索,从双耳混合信号中分离出文本描述的声音事件。此外,我们利用提取网络中的空间特征联合预测目标声音的波达方向(DoA)。这种双任务方法利用互补的位置信息来提高提取性能,同时实现准确的 DoA 估计。在真实场景 AudioCaps 数据集上的实验结果表明,我们提出的 LuSeeL 模型显著优于单通道和单任务基线模型。
引用
@article{arxiv.2601.19153,
title = {LuSeeL: Language-queried Binaural Universal Sound Event Extraction and Localization},
author = {Zexu Pan and Shengkui Zhao and Yukun Ma and Haoxu Wang and Yiheng Jiang and Biao Tian and Bin Ma},
journal= {arXiv preprint arXiv:2601.19153},
year = {2026}
}
备注
ICASSP 2026