面向细粒度自监督学习的开放集核心集采样
计算机视觉与模式识别
2023-03-27 v2
摘要
通用领域的深度学习不断被扩展到需要识别细粒度特征的特定领域任务。然而,细粒度任务的现实应用面临两个挑战:高度依赖专家知识进行标注,以及需要适用于特定领域中各种下游任务(例如类别、边界框或像素级标注的预测)的通用模型。幸运的是,近期的自监督学习(SSL)是一种无需标注即可预训练模型的有前景的方法,可作为任何下游任务的有效初始化。由于 SSL 不依赖标注的存在,通常利用被称为开放集的大规模无标注数据集。在此意义上,我们引入了一种新的开放集自监督学习问题,假设在预训练阶段可获得大规模无标注开放集以及细粒度目标数据集。在我们的问题设定中,考虑开放集与目标数据集之间的分布失配至关重要。因此,我们提出 SimCore 算法来采样核心集,即开放集中在潜空间中对目标数据集具有最小距离的 subset。我们通过大量实验设置(包括十一个细粒度数据集和七个开放集在各种下游任务中)证明 SimCore 显著提升了表示学习性能。
引用
@article{arxiv.2303.11101,
title = {Coreset Sampling from Open-Set for Fine-Grained Self-Supervised Learning},
author = {Sungnyun Kim and Sangmin Bae and Se-Young Yun},
journal= {arXiv preprint arXiv:2303.11101},
year = {2023}
}
备注
CVPR 2023