关于主动学习的边际收益:自监督是否既占便宜又免单?
机器学习
2020-11-17 v1
摘要
主动学习是一组用于智能标注大型无标签数据集以减少标注工作的技术。与此同时,自监督与半监督学习(S4L)的近期进展提供了基于数据增强、对比学习和自训练的强大技术,使其能够更好地利用无标签数据,从而在标准机器学习基准中显著减少了所需标注量。一个自然的问题是这些范式能否统一以获得更优结果。为此,本文提供了一种集成自监督预训练、主动学习和一致性正则化自训练的新算法框架。我们在 CIFAR10 与 CIFAR100 数据集上用该框架进行了大量实验。这些实验使我们能够隔离并评估各独立组件的好处,其使用最先进方法(如 Core-Set、VAAL、simCLR、FixMatch)进行评价。我们的实验揭示了两个关键见解:(i) 自监督预训练显著改善半监督学习,尤其在少标签情形下;(ii) 主动学习的收益被 S4L 技术削弱并涵盖。具体而言,当将最先进的主动学习算法与最先进的 S4L 技术结合时,我们未能观察到任何额外收益。
引用
@article{arxiv.2011.08121,
title = {On the Marginal Benefit of Active Learning: Does Self-Supervision Eat Its Cake?},
author = {Yao-Chun Chan and Mingchen Li and Samet Oymak},
journal= {arXiv preprint arXiv:2011.08121},
year = {2020}
}