面向声源定位且具有不平衡校正的解析增量学习
声音
2026-01-27 v1 人工智能
摘要
声源定位(SSL)在受控环境中表现出色,但在实际部署中由于双重不平衡挑战而面临困难:由长尾到达方向分布引起的任务内不平衡,以及由跨任务偏斜和重叠引起的任务间不平衡。这些往往导致灾难性遗忘,显著降低定位精度。为缓解这些问题,我们提出了一个包含两项关键创新的统一框架。具体而言,我们设计了一种基于 GCC-PHAT 的数据增强(GDA)方法,利用峰值特征缓解任务内分布偏斜。我们还提出了一种具有任务自适应正则化的解析动态不平衡校正器(ADIR),能够进行适应任务间动态的解析更新。在 SSLR 基准上,我们的方法取得了 89.0% 准确率、5.3° 平均绝对误差和 1.6 后向转移的最先进结果,证明了在无样本存储的情况下对不断演变的不平衡具有鲁棒性。
引用
@article{arxiv.2601.18335,
title = {Analytic Incremental Learning For Sound Source Localization With Imbalance Rectification},
author = {Zexia Fan and Yu Chen and Qiquan Zhang and Kainan Chen and Xinyuan Qian},
journal= {arXiv preprint arXiv:2601.18335},
year = {2026}
}
备注
Accepted by ICASSP26