中文

检测任意声音:基于多模态查询的开放词汇声音事件检测

声音 2025-10-28 v2 人工智能 音频与语音处理

摘要

大多数现有的声音事件检测(SED)算法在闭集假设下运行,将其检测能力限制在预定义类别内。虽然最近的工作通过利用音频-语言模型探索了语言驱动的零样本 SED,但由于缺乏细粒度对齐和跨模态特征融合,其性能仍远不能令人满意。在这项工作中,我们提出了检测任意声音模型(DASM),这是一个由多模态查询引导的、用于开放词汇 SED 的基于查询的框架。DASM 将 SED 形式化为帧级检索任务,其中音频特征与从文本或音频提示导出的查询向量进行匹配。为了支持这种形式化,DASM 引入了一个双流解码器,该解码器显式地解耦事件识别和时间定位:跨模态事件解码器执行查询-特征融合并确定片段级的声音事件存在,而上下文网络则对时间依赖性进行建模以实现帧级定位。此外,提出了一种推理时注意力掩蔽策略,以利用基类和新类之间的语义关系,从而大幅增强对新类的泛化能力。在 AudioSet Strong 数据集上的实验表明,DASM 有效地平衡了定位准确性与对新类的泛化,在开放词汇设置下优于基于 CLAP 的方法(+7.8 PSDS),在闭集设置下优于基线(+6.9 PSDS)。此外,在 DESED 上的跨数据集零样本评估中,DASM 达到了 42.2 的 PSDS1 分数,甚至超过了有监督的 CRNN 基线。项目页面位于 https://cai525.github.io/Transformer4SED/demo_page/DASM/。

关键词

引用

@article{arxiv.2507.16343,
  title  = {Detect Any Sound: Open-Vocabulary Sound Event Detection with Multi-Modal Queries},
  author = {Pengfei Cai and Yan Song and Qing Gu and Nan Jiang and Haoyu Song and Ian McLoughlin},
  journal= {arXiv preprint arXiv:2507.16343},
  year   = {2025}
}

备注

Accepted by MM 2025