文档筛选中基于众包的主动学习
信息检索
2020-12-07 v1 计算与语言
机器学习
摘要
在本文中,我们探索如何高效结合众包与机器智能来解决文档筛选问题,其中我们需要用一组机器学习过滤器对文档进行筛选。具体而言,我们专注于构建一组评估文档并高效筛选它们的机器学习分类器。这是一项具有挑战性的任务,因为预算有限且用给定预算处理该问题的方式有无数种。我们提出了一种多标签主动学习筛选专用采样技术——目标感知采样(objective-aware sampling)——用于查询未标注文档以供标注。我们的算法决定哪个机器过滤器需要更多训练数据,以及如何选择未标注项进行标注,以最小化整体分类错误的风险,而非最小化单一过滤器错误。我们证明目标感知采样显著优于最先进的主动学习采样策略。
引用
@article{arxiv.2012.02297,
title = {Active Learning from Crowd in Document Screening},
author = {Evgeny Krivosheev and Burcu Sayin and Alessandro Bozzon and Zoltán Szlávik},
journal= {arXiv preprint arXiv:2012.02297},
year = {2020}
}
备注
Crowd Science Workshop at NeurIPS 2020