中文

论 revisit SSL 在声事件检测中的应用:互补融合与自适应后处理

音频与语音处理 2025-08-27 v2 人工智能 声音

摘要

自监督学习(SSL)模型为声事件检测(SED)提供了强大的表征能力,但其协同潜力仍未得到充分探索。本研究系统评估了最新的 SSL 模型,以指导最佳模型选择与集成。我们提出框架通过三种融合策略整合异构 SSL 表征(如 BEATs、HuBERT、WavLM):单一 SSL 嵌入整合、双模态融合与全聚合。DCASE 2023 Task 4 挑战实验表明,双模态融合(如 CRNN+BEATs+WavLM)实现互补性能提升,而 CRNN+BEATs 单独使用在各 SSL 模型中表现最佳。我们进一步引入归一化声事件边界框(nSEBBs),一种自适应后处理方法,动态调整事件边界预测,使独立 SSL 模型的 PSDS1 指标提升最高可达4%。这些发现凸显了 SSL 架构的兼容性与互补性,为任务定制化融合与稳健的 SED 系统设计提供指导。

关键词

引用

@article{arxiv.2505.11889,
  title  = {Revisiting SSL for sound event detection: complementary fusion and adaptive post-processing},
  author = {Hanfang Cui and Longfei Song and Li Li and Dongxing Xu and Yanhua Long},
  journal= {arXiv preprint arXiv:2505.11889},
  year   = {2025}
}

备注

27 pages, 5 figures, accepted by Journal of King Saud University Computer and Information Sciences online