中文

FSD50K-Solo:单源声事件的自动化 curated

音频与语音处理 2026-05-28 v2 声音

摘要

高质量的训练数据集是神经网络性能的关键因素。然而,音频领域仍缺乏大规模、标注严格且单源声事件数据集。虽然 FSD50K 数据集规模相对较大且开放,但包含相当比例的多源样本,背景干扰或重叠事件可能限制数据的实用性。为此,我们引入一个针对大规模开放音频语料库的 data curation 框架。我们的方法利用生成式扩散模型合成干净的单类事件,以构建受控的噪声混合样本进行监督。随后,我们采用预训练的音频编码器搭配判别式分类器,自动识别并过滤掉多源样本。实验表明,我们的框架在由人类专家 curated 的测试集上取得优异性能。最终,我们发布了 FSD50K-Solo,这是一个由我们的模型 curated 出的包含单源音频样本的子集。除了 FSD50K,我们的方法为 curate 开源音频语料库树立了可扩展的范式。

关键词

引用

@article{arxiv.2605.13931,
  title  = {FSD50K-Solo: Automated Curation of Single-Source Sound Events},
  author = {Ningyuan Yang and Sile Yin and Li-Chia Yang and Bryce Irvin and Xiao Quan and Marko Stamenovic and Shuo Zhang},
  journal= {arXiv preprint arXiv:2605.13931},
  year   = {2026}
}

备注

Accepted to EUSIPCO 2026. 5 pages, 3 figures