中文

通过示例质量实现最优主动学习

机器学习 2014-07-31 v1 机器学习

摘要

在许多分类问题中,未标记数据十分丰富,可以选择其子集进行标记。这定义了主动学习 (AL) 的背景,其中方法系统地选择该子集,通过重新训练来改进分类器。给定一个分类问题和一个在少量标记示例上训练的分类器,考虑选择单个额外示例。该示例将由预言机标记,然后用于重新训练分类器。这种示例选择提出了一个核心问题:给定分类问题的完全指定的随机描述,哪个示例是最优选择?如果最优性是根据损失定义的,则该定义直接产生期望损失减少 (ELR),这是一个核心量,其最大值产生最优示例选择。本工作提出了一种新的 AL 理论方法,即示例质量,它根据 ELR 定义最优 AL 行为。一旦在数学上定义了最优 AL 行为,对此抽象进行推理即可提供对 AL 的见解。在理论背景下,将最优选择与现有 AL 方法进行比较,表明启发式方法可能会做出次优选择。我们构建了算法来直接估计示例质量。大规模实验研究表明,这些算法与标准 AL 方法具有竞争力。

关键词

引用

@article{arxiv.1407.8042,
  title  = {Targeting Optimal Active Learning via Example Quality},
  author = {Lewis P. G. Evans and Niall M. Adams and Christoforos Anagnostopoulos},
  journal= {arXiv preprint arXiv:1407.8042},
  year   = {2014}
}