中文

一种具有质量保证的激励相容多臂老虎机众包机制

计算机科学与博弈论 2015-06-18 v3 机器学习

摘要

考虑一位请求者希望以成本最优的方式,将一系列相同的二值标注任务众包给一群工人,以确保每项任务达到既定的准确率。工人的质量各异且未知但固定,其成本为私有信息。问题在于为每项任务选择一个最优的工人子集,使得从所选工人处获得的结果能够保证目标准确率水平。即使在非策略性设定下,该问题也极具挑战性,因为聚合标签的准确率取决于未知的质量。我们开发了一种新颖的多臂老虎机 (MAB) 机制来解决此问题。首先,我们提出了一个名为“保证准确率老虎机”(Assured Accuracy Bandit, AAB) 的框架,该框架导出了针对非策略性设定的约束置信界 (Constrained Confidence Bound for a Non Strategic setting, CCB-NS) MAB 算法。我们推导出了算法选择次优集合的时间步数上界,该上界取决于目标准确率水平和真实质量。当请求者不仅需要学习工人的质量,还需要 eliciting 其真实成本时,情况更为复杂。我们修改了 CCB-NS 算法,得到了一种自适应探索分离算法,称为“策略性设定的约束置信界”(Constrained Confidence Bound for a Strategic setting, CCB-S)。CCB-S 算法产生了一个事后单调分配规则,因此可以转化为一种事后激励相容且事后个体理性的机制,该机制能以成本最优的方式学习工人质量并保证给定的目标准确率水平。我们提供了任何算法选择次优集合次数的下界,并发现该下界与我们的上界在常数因子内相匹配。我们通过一个说明性示例提供了该框架实际实施的见解,并通过仿真展示了我们算法的有效性。

关键词

引用

@article{arxiv.1406.7157,
  title  = {An Incentive Compatible Multi-Armed-Bandit Crowdsourcing Mechanism with Quality Assurance},
  author = {Shweta Jain and Sujit Gujar and Satyanath Bhat and Onno Zoeter and Y. Narahari},
  journal= {arXiv preprint arXiv:1406.7157},
  year   = {2015}
}