中文

众包序列标签的真值发现

人机交互 2023-07-04 v2 机器学习

摘要

标注的质量与数量正向影响着序列标注(自然语言处理中的一项重要任务)的学习性能。聘请领域专家对语料库进行标注在金钱与时间上成本高昂。诸如 Amazon Mechanical Turk (AMT) 等众包平台已被部署以辅助完成此目的。然而,由于众包工人缺乏专业知识,以此方式收集的标注容易出现人为错误。现有的标注聚合文献假设标注是独立的,因此在处理具有复杂依赖关系的序列标签聚合任务时面临挑战。为应对这些挑战,我们提出了一种基于优化的方法,利用工人为序列标注任务提供的标注来推断真值标签。所提出的众包序列标签聚合方法(AggSLCAggSLC)综合考虑了序列标注任务的特性、工人的可靠性以及先进的机器学习技术。对算法收敛性的理论分析进一步表明,所提出的 AggSLCAggSLC 在有限次迭代后终止。我们在用于命名实体识别(NER)任务与生物医学(PICO)信息抽取任务的多个众包数据集以及一个模拟数据集上对 AggSLCAggSLC 进行了评估。结果表明,所提出的方法优于当前最先进的聚合方法。为了深入了解该框架,我们通过消融实验研究了 AggSLCAggSLC 各组件的有效性。

关键词

引用

@article{arxiv.2109.04470,
  title  = {Truth Discovery in Sequence Labels from Crowds},
  author = {Nasim Sabetpour and Adithya Kulkarni and Sihong Xie and Qi Li},
  journal= {arXiv preprint arXiv:2109.04470},
  year   = {2023}
}