中文

超越多数投票:基于一致性聚类的标注者视角建模方法用于主观 NLP 任务

计算与语言 2026-05-12 v1

摘要

标注中的分歧是 NLP 数据集开发中的常见现象,也是富有价值的洞察来源。虽然多数投票仍然是聚合标签的主导策略,但近期的工作探索了对单个标注者进行建模以保留其视角。然而,对每个标注者进行建模是资源密集型的,且在各种 NLP 任务中仍探讨不足。我们提出了一种基于一致性的聚类技术来建模标注者之间的分歧。我们在 40 个数据集上进行了全面实验,涵盖 18 种类型学上多样的语言,涉及三个主观 NLP 任务:情感分析、情感分类和仇恨言论检测。我们评估了四种聚合方法:多数投票、集成、多标签和多任务。结果表明,与多数投票和单个标注者建模相比,基于一致性的聚类能够利用标注者视角的全谱,并显著提升主观 NLP 任务的分类性能。在聚合方法方面,多标签和多任务方法比集成和模型多数投票更适合对聚类后的标注者进行建模。

关键词

引用

@article{arxiv.2605.09955,
  title  = {Beyond Majority Voting: Agreement-Based Clustering to Model Annotator Perspectives in Subjective NLP Tasks},
  author = {Tadesse Destaw Belay and Ibrahim Said Ahmad and Idris Abdulmumin and Abinew Ali Ayele and Alexander Gelbukh and Eusebio Ricárdez-Vázquez and Olga Kolesnikova and Shamsuddeen Hassan Muhammad and Seid Muhie Yimam},
  journal= {arXiv preprint arXiv:2605.09955},
  year   = {2026}
}

备注

Pre-MIT Press publication version