中文

从大规模音频标记到实时可解释式应急车警笛检测

声音 2025-07-01 v1 人工智能 音频与语音处理

摘要

准确识别应急车(Emergency Vehicle, EV)警笛对于将智能交通系统、智慧城市监测系统和自动驾驶技术集成至关重要。现代自动化解决方案受限于缺乏大规模、精心策划的数据集,以及先进声事件检测模型的计算需求。本工作引入 E2PANNs(Efficient Emergency Pre trained Audio Neural Networks),这是一种源自 PANNs 框架的轻量级卷积神经网络架构,专为二分类应急车警笛检测进行优化。利用我们专门准备的 AudioSet 子集(AudioSet EV),我们对 E2PANNs 在多个参考数据集上进行 fine-tuning 和评估,并测试其在嵌入式硬件上的可行性。实验campaign包括消融研究、跨域基准测试以及在边缘设备上的实时推理部署。解释性分析利用 Guided Backpropagation 和 ScoreCAM 算法提供关于模型内部表示的见解,并验证其捕获不同类型应急车警笛相关的谱时间模式的能力。通过帧级和基于事件的检测指标评估实时性能,以及对误报激活的详细分析。结果表明,E2PANns 在该研究领域建立了新的 state of the art,具有高计算效率,适用于边缘化音频监测和安全关键应用。

关键词

引用

@article{arxiv.2506.23437,
  title  = {From Large-scale Audio Tagging to Real-Time Explainable Emergency Vehicle Sirens Detection},
  author = {Stefano Giacomelli and Marco Giordano and Claudia Rinaldi and Fabio Graziosi},
  journal= {arXiv preprint arXiv:2506.23437},
  year   = {2025}
}

备注

pre-print (submitted to the IEEE/ACM Transactions on Audio, Speech, and Language Processing)