中文

别怪数据,要怪模型:理解从主观标注中学习时的噪声与偏差

计算与语言 2024-03-08 v1 计算机与社会

摘要

研究人员已意识到聚合标签的危害,特别是在人类标注者之间自然存在分歧的主观任务中。在本工作中,我们表明,仅提供聚合标签的模型在高分歧数据实例上表现出低置信度。虽然先前的研究将此类实例视为错误标注,但我们认为,高分歧文本实例难以学习的原因在于,传统的聚合模型在从主观任务中提取有用信号方面表现不佳。受最近展示从原始标注中学习有效性的研究启发,我们研究了使用多真值(Multi-GT)方法进行分类。我们的实验显示,高分歧实例的置信度有所提高。

关键词

引用

@article{arxiv.2403.04085,
  title  = {Don't Blame the Data, Blame the Model: Understanding Noise and Bias When Learning from Subjective Annotations},
  author = {Abhishek Anand and Negar Mokhberian and Prathyusha Naresh Kumar and Anweasha Saha and Zihao He and Ashwin Rao and Fred Morstatter and Kristina Lerman},
  journal= {arXiv preprint arXiv:2403.04085},
  year   = {2024}
}