通过少样本标注员适应实现主观任务的成本效益标注与建模
计算与语言
2024-09-06 v2
摘要
在主观 NLP 任务中,由于不存在唯一的真实答案,不同标注员的独特视角变得至关重要,因为这些视角显著影响注释结果。在现实场景中,注释预算常常成为决定数据中包含的视角数量(即标注员数量)及后续建模的主要因素。我们引入了一个新的框架,用于主观任务的注释收集与建模,旨在最小化注释预算,同时最大化每个标注员的预测性能。我们的框架具有两个阶段的设计:首先,我们依赖小组标注员构建一个多任务模型;其次,通过为每个标注员战略性地标注少量样本来扩展模型以适应新的视角。为大规模测试我们的框架,我们引入并发布了一个独特的数据集——道德基础主观语料库(Moral Foundations Subjective Corpus),包含 2000 篇 Reddit 帖子,由 24 名标注员对道德情感进行标注。我们展示,我们的框架在两个数据集上以仅 25% 原注释预算的情况下超越了之前的 SOTA,能够更好地捕捉标注员的个人视角。此外,我们的框架导致更公平的模型,减少了标注员之间的性能差异。
引用
@article{arxiv.2402.14101,
title = {Cost-Efficient Subjective Task Annotation and Modeling through Few-Shot Annotator Adaptation},
author = {Preni Golazizian and Alireza S. Ziabari and Ali Omrani and Morteza Dehghani},
journal= {arXiv preprint arXiv:2402.14101},
year = {2024}
}