中文

我们是在建模任务还是标注者?自然语言理解数据集中标注者偏差的调查

计算与语言 2019-08-29 v2

摘要

近年来,众包已成为创建自然语言理解数据集的普遍范式。一种常见的众包实践是招募少量高质量工作者,并让他们大规模生成示例。仅由少数工作者生成大多数示例引发了对数据多样性的担忧,尤其是当工作者自由生成句子时。在本文中,我们进行了一系列实验,表明这些担忧在三个近期NLP数据集中是明显的。我们表明,当使用标注者标识符作为特征进行训练时,模型性能有所提升,并且模型能够识别出最高产的标注者。此外,我们表明,模型通常不能很好地泛化到来自未参与训练集的标注者的示例。我们的发现表明,在数据集创建过程中应监控标注者偏差,并且测试集标注者应与训练集标注者不相交。

关键词

引用

@article{arxiv.1908.07898,
  title  = {Are We Modeling the Task or the Annotator? An Investigation of Annotator Bias in Natural Language Understanding Datasets},
  author = {Mor Geva and Yoav Goldberg and Jonathan Berant},
  journal= {arXiv preprint arXiv:1908.07898},
  year   = {2019}
}

备注

EMNLP-IJCNLP 2019