面向众包的工人-任务专业化模型:高效推断与基本极限
人机交互
2023-09-14 v3 信息论
机器学习
math.IT
机器学习
摘要
众包系统已成为利用非专家工人以相对较低成本标注数据的有效平台。然而,从数据上的多个噪声答案中推断正确标签一直是一个具有挑战性的问题,因为答案的质量在不同任务和工人之间差异很大。许多现有工作假设工人的技能水平存在固定排序,并专注于估计工人技能,以不同权重聚合工人答案。但在实践中,工人技能在不同任务间变化很大,尤其是当任务具有异质性时。本文考虑了一种新模型,称为 d-型专业化模型,其中每个任务和工人都有其自身(未知)的类型,且每个工人的可靠性会随给定任务类型和工人类型而变化。我们允许类型数量 d 随任务数量缩放。在此模型中,我们刻画了在任意给定精度内正确推断标签的最优样本复杂度,并提出了即使在任务类型或工人类型未知时也能达到序级最优极限的标签推断算法。我们在合成数据集和真实数据集上进行了实验,结果表明我们的算法优于基于更严格模型假设开发的现有算法。
引用
@article{arxiv.2111.12550,
title = {A Worker-Task Specialization Model for Crowdsourcing: Efficient Inference and Fundamental Limits},
author = {Doyeon Kim and Jeonghwan Lee and Hye Won Chung},
journal= {arXiv preprint arXiv:2111.12550},
year = {2023}
}
备注
To appear at IEEE Transactions on Information Theory