T-Crowd:面向表格数据的有效众包
数据库
2017-08-08 v1
摘要
众包雇佣人类工作者来解决计算机难以处理的问题,例如数据清洗、实体解析和情感分析。在对表格数据(例如实体集的属性值)进行众包时,工作者对不同属性(例如某位明星的国籍和年龄)的回答通常被独立处理。这一假设并不总是成立,可能导致次优的众包性能。在本文中,我们提出了 T-Crowd 系统,该系统考虑了任务之间的复杂关系,以便更快地收敛到其真实值。具体而言,T-Crowd 整合每个工作者对不同属性的回答,以有效地学习其可信度和真实数据值。属性关系信息也被用于指导向工作者分配任务。最后,T-Crowd 无缝支持分类属性和连续属性,这两者是典型数据库中的主要数据类型。我们在真实和合成数据集上的大量实验表明,T-Crowd 在真值推断和降低众包成本方面优于现有方法。
引用
@article{arxiv.1708.02125,
title = {T-Crowd: Effective Crowdsourcing for Tabular Data},
author = {Caihua Shan and Nikos Mamoulis and Guoliang Li and Reynold Cheng and Zhipeng Huang and Yudian Zheng},
journal= {arXiv preprint arXiv:1708.02125},
year = {2017}
}