ImageNet 规模的主动学习
计算机视觉与模式识别
2021-11-29 v1 人工智能
摘要
主动学习(AL)算法旨在识别用于标注的最优数据子集,使得深度神经网络(DNN)在该已标注子集上训练时能获得更好的性能。AL在数据标注成本高昂且从业者使用一切可用工具来提升模型性能的工业级场景中尤为关键。自监督预训练(SSP)的近期成功凸显了利用大量未标注数据来提升模型性能的重要性。通过将AL与SSP结合,我们可以利用未标注数据,同时对特别具有信息量的样本进行标注和训练。在本工作中,我们在ImageNet上研究了AL与SSP的结合。我们发现,在小型玩具数据集(文献中的典型基准设置)上的性能并不能代表在ImageNet上的性能,这是由于主动学习器选择的样本存在类别不平衡。在我们测试的现有基线中,跨越各种小规模和大规模设置的流行AL算法均未能优于随机采样。为解决类别不平衡问题,我们提出了平衡选择(BASE),这是一种简单、可扩展的AL算法,通过选择比现有方法更平衡的样本进行标注,从而持续优于随机采样。我们的代码可在:https://github.com/zeyademam/active_learning 获取。
引用
@article{arxiv.2111.12880,
title = {Active Learning at the ImageNet Scale},
author = {Zeyad Ali Sami Emam and Hong-Min Chu and Ping-Yeh Chiang and Wojciech Czaja and Richard Leapman and Micah Goldblum and Tom Goldstein},
journal= {arXiv preprint arXiv:2111.12880},
year = {2021}
}