中文

SEPT:面向可扩展且高效的视觉预训练

计算机视觉与模式识别 2022-12-13 v1

摘要

近年来,自监督预训练范式在利用大规模无标注数据提升下游任务性能方面展现出巨大潜力。然而,在真实场景中增加无标注预训练数据的规模需要高昂的计算成本,并面临样本未经筛选的挑战。为解决这些问题,我们基于一个简单假设——在与目标任务分布相似的无标注样本上进行预训练可带来显著的性能提升——从数据选择的角度构建了一个任务特定的自监督预训练框架。在该假设支撑下,我们提出首个新颖的可扩展且高效的视觉预训练(SEPT)框架,通过引入检索流水线进行数据选择。SEPT首先利用自监督预训练模型提取整个无标注数据集的特征以初始化检索流水线。然后,针对特定目标任务,SEPT基于特征相似度为每个目标样本从无标注数据集中检索最相似的样本用于预训练。最后,SEPT以自监督方式利用所选无标注样本预训练目标模型,再进行目标数据微调。通过将预训练规模与目标任务可用的上游数据解耦,SEPT实现了上游数据集的高可扩展性和预训练的高效率,从而带来高的模型架构灵活性。在各种下游任务上的结果表明,与ImageNet预训练相比,SEPT在将训练样本数量减少一个数量级且不依赖任何额外标注的情况下,能够达到具有竞争力甚至更优的性能。

关键词

引用

@article{arxiv.2212.05473,
  title  = {SEPT: Towards Scalable and Efficient Visual Pre-Training},
  author = {Yiqi Lin and Huabin Zheng and Huaping Zhong and Jinjing Zhu and Weijia Li and Conghui He and Lin Wang},
  journal= {arXiv preprint arXiv:2212.05473},
  year   = {2022}
}

备注

Accepted by AAAI 2023