主动多标签众包共识
机器学习
2019-11-11 v1 人机交互
摘要
众包是一种通过在线平台收集数据标注的经济高效策略。具有不同专业知识的众包工人因其服务获得报酬,而任务请求者通常预算有限。如何在预算内为多标签数据收集可靠标注并计算共识,是一个有趣且具挑战性但很少被研究的问题。本文提出一种新方法以实现主动多标签众包共识(AMCC)。AMCC 考虑了工人的共性与个性,并假设工人可被组织为不同组。每组包含一组共享相似标注行为和标签相关性的工人。为实现有效的多标签共识,AMCC 通过共性与个性的线性组合对工人标注建模,并通过给该组分配较小权重来降低不可靠工人的影响。为以更低成本收集可靠标注,AMCC 引入一种主动众包学习策略,选择样本-标签-工人三元组。在三元组中,所选样本和标签对共识模型最具信息性,且所选工人能以低成本可靠标注样本。我们在多标签数据集上的实验结果表明,AMCC 在计算众包共识和通过选择性价比三元组降低预算方面优于最先进的方案。
引用
@article{arxiv.1911.02789,
title = {Active Multi-Label Crowd Consensus},
author = {Jinzheng Tu and Guoxian Yu and Carlotta Domeniconi and Jun Wang and Xiangliang Zhang},
journal= {arXiv preprint arXiv:1911.02789},
year = {2019}
}