中文

基于提议的少样本声音事件检测:面向语音与环境声的 Perceiver 方法

音频与语音处理 2023-12-27 v2 神经与进化计算 声音

摘要

许多应用需要在长的未裁剪文档中检测并定位特定声音事件,包括关键词 spotting、医学观测以及用于保护的生物声学监测。深度学习技术常为这些任务的最优方法。然而,对于某些类型的事件,标注数据不足以训练此类模型。本文提出一种基于区域提议的少样本声音事件检测方法,利用 Perceiver 架构。鉴于缺乏合适的基准数据集,我们生成了两个新的少样本声音事件定位数据集:“Vox-CASE”(以名人语音片段作为声音事件)和“ESC-CASE”(以环境声音事件作为声音事件)。我们性能最佳的所提少样本方法在这两个数据集的 5-shot 5-way 任务上分别取得 0.483 和 0.418 的 F1 分数,相较强力的无提议少样本声音事件检测基线分别相对提升 72.5% 和 11.2%。

关键词

引用

@article{arxiv.2107.13616,
  title  = {Proposal-based Few-shot Sound Event Detection for Speech and Environmental Sounds with Perceivers},
  author = {Piper Wolters and Logan Sizemore and Chris Daw and Brian Hutchinson and Lauren Phillips},
  journal= {arXiv preprint arXiv:2107.13616},
  year   = {2023}
}

备注

Updated results based on additional experimentation and moved dataset generation prose to stand-alone section