多分类中是/否型众包的全概率模型
机器学习
2019-08-15 v3 机器学习
摘要
众包在训练集稀缺且难以获取的监督场景中已得到广泛应用。文献中的大多数众包模型假设标注者能够提供完整问题的答案。在分类任务中,完整问题要求标注者在所有可能的类别中进行辨别。然而在现实场景中,辨别并不总是容易的。标注者可能并不擅长区分所有类别。在本工作中,我们针对一种更简短的查询类型提供了全概率模型。我们的简短查询仅需“是”或“否”的回答。我们的模型估计了与标注者混淆矩阵相关的联合后验分布以及每个对象类别的后验概率。我们开发了一种近似推断方法,使用 Monte Carlo Sampling 和 Black Box Variational Inference,并提供了必要梯度的推导。我们构建了两个真实的众包场景来测试我们的模型。第一个场景查询不规则的天文时间序列。第二个场景依赖于动物图像分类。我们取得了与全查询众包相当的结果。此外,我们表明对标注者失误进行建模在估计真实类别中起着重要作用。最后,我们向社区提供了从众包实验中获得的两个真实数据集。我们所有的代码均已公开。
引用
@article{arxiv.1901.00397,
title = {A Full Probabilistic Model for Yes/No Type Crowdsourcing in Multi-Class Classification},
author = {Belen Saldias and Pavlos Protopapas and Karim Pichara},
journal= {arXiv preprint arXiv:1901.00397},
year = {2019}
}
备注
SIAM International Conference on Data Mining (SDM19), 9 official pages, 5 supplementary pages