Curator:利用自监督学习构建大规模精选标注数据集
计算机视觉与模式识别
2023-01-02 v1
摘要
尽管地球科学等领域拥有大量原始数据,但标注数据的缺乏阻碍了机器学习在这些领域的应用。例如,在卫星影像上训练野火分类器需要整理一个海量且多样的数据集,这是一个昂贵且耗时的过程,可能持续数周至数月。在超过 40 PB 的未标注数据中搜寻相关样本,要求研究者手动查找此类图像,犹如大海捞针。我们提出了一个无代码端到端流水线 Curator,大幅缩短了整理详尽标注数据集所需的时间。Curator 能够通过结合自监督、可扩展最近邻搜索与主动学习来学习并区分图像表示,从而搜索海量未标注数据。该流水线也可直接应用于解决不同领域的问题。总体而言,该流水线使研究者能够在极短时间内从仅有一张参考图像扩展到全面的数据集。
引用
@article{arxiv.2212.14099,
title = {Curator: Creating Large-Scale Curated Labelled Datasets using Self-Supervised Learning},
author = {Tarun Narayanan and Ajay Krishnan and Anirudh Koul and Siddha Ganju},
journal= {arXiv preprint arXiv:2212.14099},
year = {2023}
}
备注
AAAI Fall Symposium 2022