中文

通过开放世界采样改进不平衡种子数据上的对比学习

计算机视觉与模式识别 2021-12-10 v2

摘要

对比学习方法在以少量目标类标签学习视觉表示方面取得了巨大成功。这暗示了一个诱人的可能性:将其扩展到精心整理的“种子”基准之外,融合来自互联网规模外部来源的更多无标签图像以提升性能。然而在实践中,更大量的无标签数据会因所需更大的模型规模和更长的训练而消耗更多计算资源。此外,开放世界无标签数据通常遵循隐式的长尾类或属性分布,其中许多也不属于目标类。因此盲目利用所有无标签数据会导致数据不平衡及干扰问题。这促使我们寻求一种有原则的方法,从外部源中策略性地选择无标签数据,以为相关类学习可泛化、均衡且多样的表示。本工作中,我们提出称为模型感知 K-center(MAK)的开放世界无标签数据采样框架,其遵循三个简单原则:(1)尾部性,通过对样本在随机数据增强上的经验对比损失期望(ECLE)排序,鼓励从尾部类采样;(2)邻近性,拒绝可能干扰训练的域外离群点;(3)多样性,确保所采样样本集合的多样性。经验上,以 ImageNet-100-LT(无标签)作为种子数据集,并使用两个“含噪”外部数据源,我们证明 MAK 能持续提升所学特征的整体表示质量与类平衡性,这通过全样本与少样本设定下的线性分类器评估得到验证。代码见:https://github.com/VITA-Group/MAK

关键词

引用

@article{arxiv.2111.01004,
  title  = {Improving Contrastive Learning on Imbalanced Seed Data via Open-World Sampling},
  author = {Ziyu Jiang and Tianlong Chen and Ting Chen and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2111.01004},
  year   = {2021}
}

备注

Neurips 2021