Crowd-Calibrator:标注者分歧能否为主观任务中的校准提供信息?
计算与语言
2024-08-27 v1
摘要
NLP 中的主观任务大多被降级为客观标准,其中真实标签由多数投票决定。这掩盖了标注者分歧与标签固有的不确定性。我们认为,主观性应纳入模型决策,并在选择性预测设置下通过校准发挥直接作用。具体而言,我们不再纯粹从模型视角校准置信度,而是基于众包工作者的一致性对主观任务模型进行校准。我们的方法 Crowd-Calibrator 对众包工作者标签分布与模型自身标签分布之间的距离进行建模,以告知模型是否应放弃决策。在仇恨言论检测与自然语言推理这两个高度主观的任务上,我们的实验表明 Crowd-Calibrator 优于或达到了与现有选择性预测基线相当的性能。我们的发现突出了将人类决策纳入模型预测的价值。
引用
@article{arxiv.2408.14141,
title = {Crowd-Calibrator: Can Annotator Disagreement Inform Calibration in Subjective Tasks?},
author = {Urja Khurana and Eric Nalisnick and Antske Fokkens and Swabha Swayamdipta},
journal= {arXiv preprint arXiv:2408.14141},
year = {2024}
}
备注
Accepted at COLM 2024