在多选众包中恢复前二答案与混淆概率
人机交互
2023-06-01 v2 信息论
机器学习
math.IT
机器学习
摘要
众包已成为以成本和时间高效的方式标注大量数据的有效平台。以往多数工作聚焦于设计高效算法以仅恢复数据的真实标签。在本文中,我们考虑多选众包任务,目标是不仅恢复真实情况,还恢复最易混淆答案及其混淆概率。最易混淆答案通过揭示除真实答案外最合理的答案及其合理程度,提供了关于任务的有用信息。为从理论上分析此类场景,我们提出一个模型,其中每个任务存在区别于其余选项的前二合理答案。任务难度由前二答案间混淆的概率量化,工作者可靠性由给出前二之内答案的概率量化。在此模型下,我们提出一个两阶段推断算法以推断前二答案与混淆概率。我们表明我们的算法达到了极小极大最优收敛速率。我们进行了合成与真实数据实验,并证明我们的算法优于其他近期算法。我们还展示了我们的算法在推断任务难度以及用前二软标签训练神经网络中的适用性。
引用
@article{arxiv.2301.00006,
title = {Recovering Top-Two Answers and Confusion Probability in Multi-Choice Crowdsourcing},
author = {Hyeonsu Jeong and Hye Won Chung},
journal= {arXiv preprint arXiv:2301.00006},
year = {2023}
}
备注
ICML 2023