主动覆盖
机器学习
2021-06-07 v1 人工智能
机器学习
摘要
我们分析了主动覆盖问题,其中学习者获得一个无标签数据集,并可以顺序地标注查询样本。目标是以最少的总标签查询数来查询标注所有正类样本。我们在标准非参数假设下证明,一个经典的支撑集估计器可被改造为一种离线算法,相较于最优学习者产生 \widetilde{\Theta}(n^{D/(D+1)}) 的额外查询代价,其中 n 为数据点数量,D 为维度。随后我们提供一种简单的主动学习方法,将额外查询代价改进为 \widetilde{O}(n^{(D-1)/D})。此外,所提算法仅需访问正类标签样本,这在某些场景下提供了额外的计算与隐私益处。最后,我们表明该主动学习方法在一系列基准图像数据集上持续优于离线方法以及多种基线方法。
引用
@article{arxiv.2106.02552,
title = {Active Covering},
author = {Heinrich Jiang and Afshin Rostamizadeh},
journal= {arXiv preprint arXiv:2106.02552},
year = {2021}
}
备注
ICML 2021