探究自监督学习的基线以缩减图像分类标注成本
机器学习
2021-08-18 v1 计算机视觉与模式识别
摘要
在监督学习中,数据标注在某些条件下被视为昂贵且不可行的手段。自监督学习方法被提出以在更少标注数据下应对学习效果问题,然而,对于达到充分结果所需的标注数据规模尚缺乏把握。本研究旨在就标注数据比例绘制一条基线,使模型相较于使用额外标签训练时能获得胜任的准确率。研究采用 kaggle.com 的 cats-vs-dogs 数据集、Mnist 和 Fashion-Mnist,通过对原始数据集施加随机旋转增强来探究自监督学习任务。为揭示自监督学习中前置任务过程的真实有效性,原始数据集被划分为更小的批次,并在每个批次上重复进行含前置预训练与不含前置预训练的学习。结果表明,与纯监督学习相比,自监督学习中的前置过程在下游分类任务中提升了约 15% 的准确率。
引用
@article{arxiv.2108.07464,
title = {Investigating a Baseline Of Self Supervised Learning Towards Reducing Labeling Costs For Image Classification},
author = {Hilal AlQuabeh and Ameera Bawazeer and Abdulateef Alhashmi},
journal= {arXiv preprint arXiv:2108.07464},
year = {2021}
}
备注
10 Pages