FSD50K:一个由人工标注声音事件的开源数据集
摘要
除基于 YouTube 超过 200 万条音频、涵盖 500 多个声音类别的 AudioSet 外,现有大多数用于声音事件识别(SER)的数据集都相对较小和/或局限于特定领域。然而,AudioSet 并非开放数据集,因为其官方发布仅包含预计算的音频特征。由于 YouTube 视频逐渐消失以及使用权问题,下载原始音轨可能存在困难。为提供一个替代性的基准数据集从而推动 SER 研究,我们推出了 FSD50K,一个包含超过 5.1 万条音频片段、总时长超过 100 小时、使用从 AudioSet 本体中选取的 200 个类别进行人工标注的开放数据集。这些音频片段基于知识共享(Creative Commons)许可授权,使得该数据集(包括波形)可自由分发。我们详细描述了 FSD50K 的创建过程,针对 Freesound 数据的特殊性,包括遇到的挑战与采用的解决方案。我们给出了全面的数据集特征刻画,并讨论了其局限性与关键因素,以便基于音频信息合理使用。最后,我们进行了声音事件分类实验,以提供基线系统,并揭示在划分 Freesound 音频数据用于 SER 时需要考虑的主要因素。我们的目标是开发一个被学界广泛采纳、作为 SER 研究新开放基准的数据集。
引用
@article{arxiv.2010.00475,
title = {FSD50K: An Open Dataset of Human-Labeled Sound Events},
author = {Eduardo Fonseca and Xavier Favory and Jordi Pons and Frederic Font and Xavier Serra},
journal= {arXiv preprint arXiv:2010.00475},
year = {2022}
}
备注
Accepted version in TASLP. Main updates include: estimation of the amount of label noise in FSD50K, SNR comparison between FSD50K and AudioSet, improved description of evaluation metrics including equations, clarification of experimental methodology and some results, some content moved to Appendix for readability. https://ieeexplore.ieee.org/document/9645159