中文

从众包序列标注中学习歧义

计算与语言 2023-01-05 v1 人工智能 人机交互 机器学习

摘要

大多数众包学习方法将标注者间的不一致视为噪声标注,而专家间的不一致常是自然语言中固有歧义与不确定性的良好指示。在本文中,我们提出一种称为从众包序列标注中学习歧义(LA-SCA)的框架,以探索可靠标注者间的不一致并有效保留易混淆的标注信息。首先,开发一种层次贝叶斯模型从众包中推断真值并将可靠性相似的标注者分组。通过建模标注者所属组的大小、标注者可靠性以及各序列中元素无歧义性之间的关系,计算可靠标注者在歧义元素上的不一致,以获得标注混淆信息并纳入代价敏感序列标注。在词性标注和命名实体识别(NER)任务上的实验结果表明,我们提出的框架在从众包推断真值和预测未知序列方面取得了有竞争力的性能,且对层次聚类结果的解读有助于发现具有相似可靠性标注者的标注模式。

关键词

引用

@article{arxiv.2301.01579,
  title  = {Learning Ambiguity from Crowd Sequential Annotations},
  author = {Xiaolei Lu},
  journal= {arXiv preprint arXiv:2301.01579},
  year   = {2023}
}