标签分配的有限期望:基于监督分割与偏差削减技术的数据集标注
机器学习
2021-02-26 v2 机器学习
摘要
标注大规模未标记数据集可能是机器学习应用的主要瓶颈。我们提出了一种以整体数据集标注成本的一小部分来推断未标记数据标签的方案。我们的方案,即标签分配的有限期望(BELA),贪心地查询预言机(或人工标注者)并划分数据集,以寻找大多具有相同标签的数据子集。BELA 随后可通过每个子集中已知标签的多数投票来推断标签。BELA 通过最大化正确标注样本期望数的下界,来决定是从子集进行分割还是标注。我们的方法与现有的层次化标注方案不同,其使用监督模型来划分数据,从而避免了依赖可能不能按标签准确分组数据的无监督聚类方法。我们设计了 BELA 的策略,以避免通过这种自适应分割可能引入的偏差。我们在三个数据集上评估了 BELA,发现其优于现有的自适应标注策略。
引用
@article{arxiv.1906.07046,
title = {Bounded Expectation of Label Assignment: Dataset Annotation by Supervised Splitting with Bias-Reduction Techniques},
author = {Alyssa Herbst and Bert Huang},
journal= {arXiv preprint arXiv:1906.07046},
year = {2021}
}