基于成对共现的众包:可辨识性与算法
机器学习
2019-09-30 v1 机器学习
摘要
数据洪流带来了对数据标注的高需求。众包(或更一般地,集成学习)技术旨在通过整合标注者的含噪、非专家标注来产生准确标签。经典的Dawid-Skene估计器及其配套的期望最大化(EM)算法已被广泛使用,但其理论性质尚未被充分理解。张量方法被提出以保证Dawid-Skene模型的可辨识性,但样本复杂度是应用此类方法的障碍——因为张量方法依赖于难以在有限数据下可靠估计的三阶统计量。本文提出一种利用标注者响应成对共现的框架,其天然具有更低的样本复杂度。我们表明该方法可在现实条件下辨识Dawid-Skene模型。我们提出一种令人联想到基于凸几何的结构化矩阵分解的代数算法来高效求解模型辨识问题,以及一种用于应对更具挑战性和关键性场景的可辨识性增强算法。实验表明所提算法在多种场景下优于最先进算法。
引用
@article{arxiv.1909.12325,
title = {Crowdsourcing via Pairwise Co-occurrences: Identifiability and Algorithms},
author = {Shahana Ibrahim and Xiao Fu and Nikos Kargas and Kejun Huang},
journal= {arXiv preprint arXiv:1909.12325},
year = {2019}
}
备注
28 pages, 5 figures, to appear in 33rd NeurIPS conference, Vancouver, Canada