中文

标注中的生态谬误:建模人类标注差异超越社会人口学特征

计算与语言 2025-03-03 v1

摘要

许多 NLP 任务表现出人类标注差异,即不同的标注者对同一文本给出不同的标签。已知这种差异至少部分取决于标注者的社会人口学特征。最近的研究旨在对单个标注者的行为进行建模,而不是预测聚合标签,我们期望社会人口学信息对这些模型是有用的。另一方面,生态谬误指出,聚合的群体行为(例如平均女性标注者的行为)不一定能解释个体行为。为了在单个标注者行为模型中考虑社会人口学特征,我们向多标注者模型引入了特定群组层。在一系列针对有毒内容检测的实验中,我们发现以这种方式明确考虑社会人口学属性并不能显著提高模型性能。这一结果表明,个体标注行为所依赖的因素远不止社会人口学特征。

关键词

引用

@article{arxiv.2306.11559,
  title  = {The Ecological Fallacy in Annotation: Modelling Human Label Variation goes beyond Sociodemographics},
  author = {Matthias Orlikowski and Paul Röttger and Philipp Cimiano and Dirk Hovy},
  journal= {arXiv preprint arXiv:2306.11559},
  year   = {2025}
}

备注

ACL2023 Camera-Ready