中文

数据高效的对比自监督学习:对监督学习最有益的样本贡献最少

机器学习 2024-03-14 v5 人工智能

摘要

自监督学习从大量无标签训练数据中学习高质量表示。随着数据集规模的增长,识别出对学习此类表示贡献最大的样本变得至关重要。这通过减少所需数据量来实现高效的自监督学习。然而,量化样本对自监督学习的价值一直是一个悬而未决的问题。在这项工作中,我们首次解决了这个问题,证明了在期望上,对对比自监督学习贡献最大的样本是那些与其他样本具有最相似增强的样本。我们为对比学习在此类子集上的泛化性能提供了严格的保证。通过大量实验,我们表明可以安全地从CIFAR100中排除20%的样本,从STL10和TinyImageNet中排除40%的样本,而不影响下游任务性能。总体而言,在这些数据集上,我们方法选择的子集性能优于随机子集超过3%。有趣的是,我们还发现对对比学习贡献最大的子集,恰恰是对监督学习贡献最小的子集。代码可在https://github.com/bigml-cs-ucla/sas-data-efficient-contrastive-learning获取。

关键词

引用

@article{arxiv.2302.09195,
  title  = {Data-Efficient Contrastive Self-supervised Learning: Most Beneficial Examples for Supervised Learning Contribute the Least},
  author = {Siddharth Joshi and Baharan Mirzasoleiman},
  journal= {arXiv preprint arXiv:2302.09195},
  year   = {2024}
}

备注

Accepted to ICML 2023, Code: https://github.com/BigML-CS-UCLA/sas-data-efficient-contrastive-learning