中文

MAGENTA:基于幅度与几何增强的稳健长尾声音事件定位与检测

音频与语音处理 2025-09-22 v1 声音

摘要

基于深度学习的声音事件定位与检测(SELD)系统在现实世界的长尾数据集上性能显著下降。标准回归损失会偏向频繁类别,导致罕见事件被系统性地低估。为解决这一挑战,我们提出了 MAGENTA(Magnitude And Geometry-ENhanced Training Approach),一种在物理可解释的向量空间中抵消偏差的统一损失函数。MAGENTA 将回归误差在径向与角向分量上进行几何分解,实现针对性的稀有感知惩罚和强化方向建模。实验表明,MAGENTA 在不平衡的真实数据集上显著提升了 SELD 性能,为一类几何感知的 SELD 目标提供了原则性基础。代码已公开:https://github.com/itsjunwei/MAGENTA_ICASSP

关键词

引用

@article{arxiv.2509.15599,
  title  = {MAGENTA: Magnitude and Geometry-ENhanced Training Approach for Robust Long-Tailed Sound Event Localization and Detection},
  author = {Jun-Wei Yeow and Ee-Leng Tan and Santi Peksi and Woon-Seng Gan},
  journal= {arXiv preprint arXiv:2509.15599},
  year   = {2025}
}

备注

This work has been submitted to IEEE ICASSP 2026 for possible publication