迈向开放世界声事件检测
声音
2026-05-22 v2 人工智能
摘要
声事件检测(SED)在音频理解中发挥着至关重要的作用,广泛应用于监控、智慧城市、医疗保健和多媒体索引。然而,传统的 SED 系统在封闭世界假设下运行,限制了它们在新声事件频繁出现的真实环境中的有效性。受计算机视觉中开放世界学习成功的启发,我们引入了开放世界声事件检测(OW-SED)范式,在该范式中,模型必须检测已知事件、识别未见事件并从中增量学习。为了应对 OW-SED 的独特挑战(如重叠和模糊事件),我们提出了一种一维可变形架构,利用可变形注意力自适应地聚焦于显著的时间区域。此外,我们设计了一种新颖的开放世界可变形声事件检测 Transformer(WOOT)框架,该框架结合特征解耦来分离类特定和类无关表示,并配合一对多匹配策略和多样性损失以增强表示的多样性。实验结果表明,我们的方法在封闭世界设置下取得了略优于现有领先技术的性能,并在开放世界场景中显著优于现有基线。
引用
@article{arxiv.2605.03934,
title = {Towards Open World Sound Event Detection},
author = {P. H. Hai and L. T. Minh and L. H. Son},
journal= {arXiv preprint arXiv:2605.03934},
year = {2026}
}
备注
32 pages, 3 figures. Accepted to Signal Processing (Elsevier)