双重稳健众包
人机交互
2022-03-15 v2 机器学习
机器学习
摘要
大规模标注数据集正如我们所见,是点燃 AI 革命的不可或缺燃料。此类数据集大多使用如 Amazon Mechanical Turk 等众包服务构建,其以公道价格提供来自非专家的含噪标签。此类数据集的庞大数量意味着每个数据点仅收集少量标签是可行的。我们将测试时标签聚合问题表述为推断期望投票分数的统计估计问题。通过以监督学习器模仿工人并将其用于双重稳健估计框架,我们证明即使学习器是较差的近似,估计方差也可大幅降低。合成与真实世界实验表明,通过将双重稳健方法与自适应工人/条目选择规则结合,我们常需低得多的标签成本即可达到近乎等同于所有工人标注所有数据点的理想世界的精度。
引用
@article{arxiv.1906.08591,
title = {Doubly Robust Crowdsourcing},
author = {Chong Liu and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:1906.08591},
year = {2022}
}