中文

Merlin L48 频谱数据集

计算机视觉与模式识别 2025-11-04 v1

摘要

在单正多标签 (SPML) 设定下,数据集中每张图像仅标记一个类别的存在,而其他类别的真实存在状态则未知。挑战在于缩小这种部分标记的设定与完全监督学习之间的性能差距,而后者通常需要大量的标注预算。先前的 SPML 方法是在由随机抽取单个正标签构成的合成数据集上开发和基准测试的,这些数据集来源于 Pascal VOC、COCO、NUS-WIDE 和 CUB200 等完全标注的数据集。然而,这种合成方法不反映真实场景,无法捕捉可能导致难以误分类的细粒度复杂性。在本工作中,我们引入 L48 数据集,这是一个源自鸟类声音记录的细粒度、真实世界的多标签数据集。L48 提供自然的 SPML 设定,单标签标注针对具有挑战性的细粒度领域,同时提供两个扩展设定,使领域先验可获取额外的负标签。我们在 L48 上对现有 SPML 方法进行基准测试,观察到与合成数据集相比存在显著性能差异,并分析了方法的弱点,凸显了需要更真实且更具挑战性的基准测试的必要性。

关键词

引用

@article{arxiv.2511.00252,
  title  = {Merlin L48 Spectrogram Dataset},
  author = {Aaron Sun and Subhransu Maji and Grant Van Horn},
  journal= {arXiv preprint arXiv:2511.00252},
  year   = {2025}
}

备注

Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks