基于分布划分的独立于目标的主动学习
机器学习
2020-09-29 v2 机器学习
摘要
为了降低不可知主动学习(A^2 算法)中的标签复杂度,体积划分通过划分假设边来缩减版本空间中的 Vapnik-Chervonenkis (VC) 维。然而,体积划分的有效性严重依赖于初始假设,这一问题也被称为依赖于目标的标签复杂度差距。本文尝试通过引入数密度这一新概念来最小化这一差距,该概念提供了一种比体积更自然、更直接的方式来描述假设分布。通过发现假设与输入分布之间的联系,我们将版本空间的体积映射到数密度,并提出一种独立于目标的分布划分策略,具有以下优势:1)提供与体积划分一样降低标签复杂度和错误率的理论保证;2)打破初始假设的诅咒;3)为真实主动学习任务中独立于目标的主动学习算法提供模型指导。在这些保证下,为了应用于主动学习,我们将输入分布划分为更多接近最优的球体,并开发了一种称为基于分布的 A^2 (DA^2) 的应用算法。实验进一步验证了 DA^2 的减半与查询能力的有效性。本文的贡献如下。
引用
@article{arxiv.1809.10962,
title = {Target-Independent Active Learning via Distribution-Splitting},
author = {Xiaofeng Cao and Ivor W. Tsang and Xiaofeng Xu and Guandong Xu},
journal= {arXiv preprint arXiv:1809.10962},
year = {2020}
}
备注
This paper has been withdrawn. The first author quitted the PhD study from AAI, University of Technology Sydney. The manuscript stopped updating