中文

面向具有内在不同任务类型的众包的谱聚类方法

机器学习 2024-08-13 v2 人工智能 应用统计

摘要

Dawid-Skene 模型是分析众包算法时最广泛采用的模型,该类算法从带噪声的工人响应中估计真值标签。在本文中,我们的动机来自这样一类众包应用:工人具有各异的技能组合,且其准确率还依赖于任务的类型。虽然对每个工人使用单一权重向量的加权多数投票(WMV)在 Dawid-Skene 模型中达到最优标签估计误差,我们证明对多类型模型而言不同任务类型需采用不同权重。聚焦于存在两类任务的情形,我们提出一种谱方法将任务划分为按类型聚类的两组。我们的分析表明,若工人数 nn 随任务数 dd 呈对数增长,则可完美恢复任务类型。随后任何为 Dawid-Skene 模型设计的算法均可独立应用于各类型以推断标签。数值实验展示了在估计真值标签前按类型聚类任务如何提升众包算法在实际应用中的性能。

关键词

引用

@article{arxiv.2302.07393,
  title  = {Spectral Clustering for Crowdsourcing with Inherently Distinct Task Types},
  author = {Saptarshi Mandal and Seo Taek Kong and Dimitrios Katselis and R. Srikant},
  journal= {arXiv preprint arXiv:2302.07393},
  year   = {2024}
}