中文

一种基于排列的众包标注模型:最优估计与鲁棒性

机器学习 2021-01-12 v3 人工智能 信息论 math.IT 机器学习

摘要

随着众包平台和海量数据集的出现,聚合与去噪众包标注数据的任务变得愈发重要。我们提出了一种基于排列的众包标注数据模型,该模型是对经典 Dawid-Skene 模型的显著推广,并引入了一种新的误差度量,用以比较不同的估计器。我们推导了基于排列模型的全局极小极大收敛速率,该速率在相差对数因子的意义下是精确的,并与在更简单的 Dawid-Skene 模型下推导的极小极大下界相匹配。随后,我们设计了两种计算高效的估计器:WAN 估计器适用于工人能力排序大致已知的情形,而 OBI-WAN 估计器则适用于该排序未知的情形。对于这两种估计器,我们都给出了其性能的非渐近界。我们在合成数据和真实世界的众包数据上进行了模拟与实验,实验结果证实了我们的理论发现。

关键词

引用

@article{arxiv.1606.09632,
  title  = {A Permutation-based Model for Crowd Labeling: Optimal Estimation and Robustness},
  author = {Nihar B. Shah and Sivaraman Balakrishnan and Martin J. Wainwright},
  journal= {arXiv preprint arXiv:1606.09632},
  year   = {2021}
}

备注

in IEEE Transactions on Information Theory (online), 2020