基于 Fisher 核自监督的偏置数据集深度主动学习
计算机视觉与模式识别
2020-03-03 v1 人工智能
摘要
主动学习(AL)旨在通过选择最具代表性的数据点进行标注,从而最小化对数据需求庞大的深度神经网络(DNN)的标注工作量。然而,当前使用的方法难以应对偏置数据。本文的主要动机是考虑一种现实的基于池的半监督 AL 设定,其中未标注的训练数据集合存在偏置。我们在该设定下从理论上推导出一个最优的 AL 获取函数。它可表述为未标注训练数据与弱标注验证数据集之间的分布偏移最小化。为实现该获取函数,我们提出了一种使用自监督 Fisher 核(FK)进行特征密度匹配的低成本方法,以及若干新颖的伪标签估计器。我们的基于 FK 的方法在 MNIST、SVHN 和 ImageNet 分类上优于最先进的方法,同时仅需 1/10 的计算量。所进行的实验表明,相较于现有方法,对于偏置的类不平衡数据,标注工作量至少降低了 40%。
引用
@article{arxiv.2003.00393,
title = {Deep Active Learning for Biased Datasets via Fisher Kernel Self-Supervision},
author = {Denis Gudovskiy and Alec Hodgkinson and Takuya Yamaguchi and Sotaro Tsukizawa},
journal= {arXiv preprint arXiv:2003.00393},
year = {2020}
}
备注
Accepted to CVPR 2020. Preprint