中文

公式监督的声音事件检测:无需真实数据的预训练

声音 2025-04-08 v1 人工智能

摘要

本文提出了一种新颖的公式驱动监督学习(FDSL)框架,通过利用公式驱动方法参数化合成的声学信号来预训练环境声音分析模型。具体来说,我们概述了详细步骤,并评估了其在声音事件检测(SED)中的有效性。SED任务涉及估计声音事件的类型和时间,其挑战在于获取足够数量的准确标注训练数据。此外,众所周知,人工标注的标签通常包含噪声,并受到标注者主观判断的显著影响。为了解决这些挑战,我们提出了一种新颖的预训练方法,利用合成数据集Formula-SED,其中声学数据仅基于数学公式生成。所提出的方法通过将每个时间步使用的合成参数作为真实标签,实现了大规模预训练,从而消除了标签噪声和偏差。我们证明,使用Formula-SED进行大规模预训练显著提高了模型准确性并加速了训练,正如我们在DCASE2023挑战赛任务4的DESED数据集上的结果所证明的。项目页面位于https://yutoshibata07.github.io/Formula-SED/

关键词

引用

@article{arxiv.2504.04428,
  title  = {Formula-Supervised Sound Event Detection: Pre-Training Without Real Data},
  author = {Yuto Shibata and Keitaro Tanaka and Yoshiaki Bando and Keisuke Imoto and Hirokatsu Kataoka and Yoshimitsu Aoki},
  journal= {arXiv preprint arXiv:2504.04428},
  year   = {2025}
}

备注

Accepted by ICASSP 2025