中文

FlexSED:迈向开放词表的声音事件检测

音频与语音处理 2025-09-24 v1 人工智能 声音

摘要

尽管能够处理数百种声音类别的大规模声音事件检测(SED)系统近期取得了进展,但现有的多类分类框架仍存在根本性局限。它们无法处理自由文本声音查询,而此类查询能实现更灵活、更用户友好的交互;此外,它们缺乏零样本能力且少样本适应性较差。尽管已有研究探索了基于文本查询的分离方法,但这些方法主要关注声源分离,并不适合需要在庞大且多样的声音词表上进行精确时间定位和高效检测的 SED 任务。本文提出 FlexSED,一个开放词表的声音事件检测系统。FlexSED 基于预训练音频 SSL 模型和 CLAP 文本编码器,引入编码器-解码器组合与自适应融合策略,以实现从预训练权重出发的有效连续训练。为确保鲁棒的监督,该系统还采用大语言模型(LLM)在训练期间辅助事件查询选择,以应对标签缺失相关的挑战。因此,FlexSED 在 AudioSet-Strong 上取得了优于普通 SED 模型的性能,同时展现出强大的零样本与少样本能力。我们发布了代码和预训练模型,以支持基于 FlexSED 的未来研究与应用。

关键词

引用

@article{arxiv.2509.18606,
  title  = {FlexSED: Towards Open-Vocabulary Sound Event Detection},
  author = {Jiarui Hai and Helin Wang and Weizhe Guo and Mounya Elhilali},
  journal= {arXiv preprint arXiv:2509.18606},
  year   = {2025}
}