中文

医学关系抽取的众包真值

计算与语言 2018-09-27 v2 人机交互

摘要

认知计算系统需要人工标注数据用于评估,且常用于训练。收集此类数据的标准实践最小化标注者间分歧,我们发现这导致数据未能考虑语言固有的歧义性。我们提出了CrowdTruth方法,通过众包收集真值(ground truth),该方法基于标注者间分歧为文本歧义等现象提供有用信号的观察,重新考量人在机器学习中的角色。我们报告了使用该方法为causecausetreattreat关系构建医学关系抽取标注数据集,以及该数据在有监督训练实验中的表现。我们证明通过对歧义建模,从众包工人收集的标注数据可以(1)在此任务上达到领域专家的质量水平同时降低成本,且(2)比远程监督(distant supervision)在规模上提供更好的训练数据。我们进一步提出并验证了考虑人与机器在此任务上表现歧义的精度、召回率和F度量的新加权度量。

关键词

引用

@article{arxiv.1701.02185,
  title  = {Crowdsourcing Ground Truth for Medical Relation Extraction},
  author = {Anca Dumitrache and Lora Aroyo and Chris Welty},
  journal= {arXiv preprint arXiv:1701.02185},
  year   = {2018}
}

备注

Accepted for publication in ACM Transactions on Interactive Intelligent Systems (TiiS) Special Issue on Human-Centered Machine Learning