通过示例质量实现最优主动学习
机器学习
2014-07-31 v1 机器学习
摘要
在许多分类问题中,未标记数据十分丰富,可以选择其子集进行标记。这定义了主动学习 (AL) 的背景,其中方法系统地选择该子集,通过重新训练来改进分类器。给定一个分类问题和一个在少量标记示例上训练的分类器,考虑选择单个额外示例。该示例将由预言机标记,然后用于重新训练分类器。这种示例选择提出了一个核心问题:给定分类问题的完全指定的随机描述,哪个示例是最优选择?如果最优性是根据损失定义的,则该定义直接产生期望损失减少 (ELR),这是一个核心量,其最大值产生最优示例选择。本工作提出了一种新的 AL 理论方法,即示例质量,它根据 ELR 定义最优 AL 行为。一旦在数学上定义了最优 AL 行为,对此抽象进行推理即可提供对 AL 的见解。在理论背景下,将最优选择与现有 AL 方法进行比较,表明启发式方法可能会做出次优选择。我们构建了算法来直接估计示例质量。大规模实验研究表明,这些算法与标准 AL 方法具有竞争力。
引用
@article{arxiv.1407.8042,
title = {Targeting Optimal Active Learning via Example Quality},
author = {Lewis P. G. Evans and Niall M. Adams and Christoforos Anagnostopoulos},
journal= {arXiv preprint arXiv:1407.8042},
year = {2014}
}