粗略群体比较的众包:粗糙群体比较的智慧
机器学习
2017-12-14 v1 机器学习
摘要
众包已成为收集带标签训练数据的流行方法。然而,在许多实际场景中,传统标注对众包工作者而言可能很困难(例如,若数据为高维或反直觉的,或标签为连续的)。在这项工作中,我们开发了一种新颖的众包模型,可通过利用人们对群体及其之间关系的直觉来补充标准实践。我们采用一种称为Ballpark Learning的近期机器学习设定,其仅给定数据点的群体上的粗粒度聚合信号即可估计个体标签。为处理连续标签这一重要情形,我们将Ballpark设定(其聚焦于分类)扩展到回归问题。我们将该问题表述为一个凸优化问题,并提出了快速、简单且天生对离群点具有鲁棒性的方法。我们在真实世界数据集上评估了我们的方法,展示了如何从非专家群体中获取关于群体的有用约束。我们的方法可与基于许多真实标签训练的监督模型相媲美,并且能以更低的价格从群体中获得比标准标签收集过程明显更好的结果。通过收集群体实例的粗略猜测并利用机器学习推断个体标签,我们的轻量级框架能够应对核心众包挑战并以经济高效的方式训练机器学习模型。
引用
@article{arxiv.1712.04828,
title = {Ballpark Crowdsourcing: The Wisdom of Rough Group Comparisons},
author = {Tom Hope and Dafna Shahaf},
journal= {arXiv preprint arXiv:1712.04828},
year = {2017}
}