推文难度如何影响标注者的标注表现?
人机交互
2018-08-02 v1
摘要
众包是以适中成本获取标注数据(例如推文)的流行手段,这些数据随后可用于文本挖掘任务。为缓解此类场景中低质量标签的问题,已有研究分析了多种人为因素以识别并处理提供此类标签的工人。然而,一个鲜被考虑的方面是待标注推文固有的难度,以及它如何影响标注者赋予这些推文的标签的可靠性。因此,我们在本初步研究中利用Twitter上的层级情感标注任务考察了这一关联。我们发现,在假定标注者此前已标注过若干推文的前提下,两因素之间确实存在关系:分配给简单推文的标签比分配给困难推文的标签更可靠。因此,在我们的实验中,以简单推文训练预测器可将性能提升至多6%。这意味着对主动学习技术与众包的潜在改进。
引用
@article{arxiv.1808.00388,
title = {How Does Tweet Difficulty Affect Labeling Performance of Annotators?},
author = {Stefan Räbiger and Yücel Saygın and Myra Spiliopoulou},
journal= {arXiv preprint arXiv:1808.00388},
year = {2018}
}
备注
13 pages, 4 figures, "for dataset, see https://www.researchgate.net/publication/325180810_Infsci2017_dataset"