中文

ARCA23K:用于研究开集标签噪声的音频数据集

声音 2022-03-01 v2 机器学习 音频与语音处理

摘要

Freesound 等声音分享平台上音频数据的可用性使用户能访问大量带标注音频。利用此类数据训练正变得日益流行,但这类数据集中常普遍的标签噪声问题需进一步研究。本文介绍 ARCA23K,一个自动检索与整理的音频(Automatically Retrieved and Curated Audio)数据集,由超过 23000 条带标注的 Freesound 片段组成。与过去的数据集如 FSDKaggle2018 与 FSDnoisy18K 不同,ARCA23K 以更可控的方式促进标签噪声研究。我们描述创建该数据集的完整过程使其完全可复现,意味着研究者可轻松扩展我们的工作。我们表明 ARCA23K 中多数标注错误源于词汇表外音频片段,并将此类标签噪声称为开集标签噪声(open-set label noise)。我们开展了实验,从分类性能与表示学习角度研究标签噪声的影响。

关键词

引用

@article{arxiv.2109.09227,
  title  = {ARCA23K: An audio dataset for investigating open-set label noise},
  author = {Turab Iqbal and Yin Cao and Andrew Bailey and Mark D. Plumbley and Wenwu Wang},
  journal= {arXiv preprint arXiv:2109.09227},
  year   = {2022}
}

备注

Accepted to the Detection and Classification of Acoustic Scenes and Events 2021 Workshop (DCASE2021)