中文

LEAD 数据集:声音事件检测的标签如何因标注者而异?

声音 2024-10-15 v1 音频与语音处理

摘要

在本文中,我们介绍了一个大规模标注者标签用于声音事件检测(LEAD)数据集,该数据集用于更好地理解声音事件检测(SED)中强标签的变异性。在SED中,收集大规模强标签非常耗时,并且在大多数情况下,多个工作人员分工标注以创建单个数据集。通常,由多个标注者创建的强标签在声音事件类型和时间起止点上存在很大差异。通过多个工作人员的标注,唯一确定强标签相当困难,因为数据集中包含可能被误认为是相似类别的声音,以及时间起止点难以区分的声音。如果SED的强标签因标注者而异很大,那么基于由多个标注者创建的数据集训练的SED模型将存在偏差。此外,如果训练数据和评估数据的标注者不同,则存在模型无法被正确评估的风险。为了研究强标签的变异性,我们发布了LEAD数据集,该数据集为每个片段提供了由20个不同标注者标注的不同的强标签。LEAD数据集使我们能够研究强标签如何因标注者而异,并考虑对强标签变异性具有鲁棒性的SED模型。LEAD数据集由分配给来自TUT Sound Events 2016/2017、TUT Acoustic Scenes 2016和URBAN-SED的声音片段的强标签组成。我们还分析了LEAD数据集中强标签的变异性,并提供了对变异性的见解。

关键词

引用

@article{arxiv.2410.09778,
  title  = {LEAD Dataset: How Can Labels for Sound Event Detection Vary Depending on Annotators?},
  author = {Naoki Koga and Yoshiaki Bando and Keisuke Imoto},
  journal= {arXiv preprint arXiv:2410.09778},
  year   = {2024}
}

备注

Accepted to APSIPA ASC 2024