中文

面向众包序列标注的序列标注建模

计算与语言 2022-09-21 v1 机器学习

摘要

众包序列标注可以是一种高效且经济的方式来构建用于序列标注的大规模数据集。与标注独立实例不同,对于众包序列标注,标签序列的质量依赖于标注者在捕获序列中每个词元的内部依赖关系方面的专业水平。本文提出面向众包序列标注的序列标注建模(SA-SLC)。首先,开发一个条件概率模型来联合建模序列数据与标注者专业水平,其中引入类别分布来估计每个标注者在捕获局部与非局部标签依赖关系以进行序列标注时的可靠性。为加速所提模型的边缘化,提出有效标签序列推断(VLSE)方法,从众包序列标注中推导有效的真实标签序列。VLSE从词元层面推导可能的真实标签,并进一步在前向推断中剪枝用于标签序列解码的子路径。VLSE减少了候选标签序列的数量并提升了可能真实标签序列的质量。在若干自然语言处理序列标注任务上的实验结果表明了所提模型的有效性。

关键词

引用

@article{arxiv.2209.09430,
  title  = {Modeling sequential annotations for sequence labeling with crowds},
  author = {Xiaolei Lu and Tommy W. S. Chow},
  journal= {arXiv preprint arXiv:2209.09430},
  year   = {2022}
}