中文

一种用于众包中标签聚合的轻量、有效且高效的模型

人机交互 2022-12-02 v1 人工智能 机器学习

摘要

由于众包标签中存在噪声,标签聚合(LA)已成为对众包标签进行后处理的标准步骤。LA方法通过对工人质量进行建模,从众包标签中估计真实标签。大多数现有的LA方法本质上是迭代式的。它们需要多次遍历所有众包标签,以便联合且迭代地更新真实标签和工人质量,直至收敛。因此,这些方法具有较高的空间和时间复杂度。在本文中,我们将LA视为一个动态系统,并将其建模为动态贝叶斯网络。从该动态模型中,我们推导出两种轻量级算法,LA\textsuperscript{onepass}和LA\textsuperscript{twopass},它们通过最多两次遍历所有标签,即可有效且高效地估计工人质量和真实标签。由于其动态特性,所提算法也能在线估计真实标签而无需重新访问历史数据。我们从理论上证明了所提算法的收敛性,并给出了估计工人质量的误差界限。我们还分析了所提算法的空间和时间复杂度,并表明它们与多数投票相当。在20个真实世界数据集上进行的实验表明,所提算法即使在最多遍历所有标签两次的情况下,也能在离线和在线设置中有效且高效地聚合标签。

关键词

引用

@article{arxiv.2212.00007,
  title  = {A Light-weight, Effective and Efficient Model for Label Aggregation in Crowdsourcing},
  author = {Yi Yang and Zhong-Qiu Zhao and Quan Bai and Qing Liu and Weihua Li},
  journal= {arXiv preprint arXiv:2212.00007},
  year   = {2022}
}