医学关系抽取的众包真值
计算与语言
2018-09-27 v2 人机交互
摘要
认知计算系统需要人工标注数据用于评估,且常用于训练。收集此类数据的标准实践最小化标注者间分歧,我们发现这导致数据未能考虑语言固有的歧义性。我们提出了CrowdTruth方法,通过众包收集真值(ground truth),该方法基于标注者间分歧为文本歧义等现象提供有用信号的观察,重新考量人在机器学习中的角色。我们报告了使用该方法为和关系构建医学关系抽取标注数据集,以及该数据在有监督训练实验中的表现。我们证明通过对歧义建模,从众包工人收集的标注数据可以(1)在此任务上达到领域专家的质量水平同时降低成本,且(2)比远程监督(distant supervision)在规模上提供更好的训练数据。我们进一步提出并验证了考虑人与机器在此任务上表现歧义的精度、召回率和F度量的新加权度量。
引用
@article{arxiv.1701.02185,
title = {Crowdsourcing Ground Truth for Medical Relation Extraction},
author = {Anca Dumitrache and Lora Aroyo and Chris Welty},
journal= {arXiv preprint arXiv:1701.02185},
year = {2018}
}
备注
Accepted for publication in ACM Transactions on Interactive Intelligent Systems (TiiS) Special Issue on Human-Centered Machine Learning