利用众包揭示关系抽取黄金标准中的歧义
计算与语言
2015-05-26 v1 定量方法
摘要
语义关系抽取是生物医学自然语言处理研究的前沿之一。黄金标准是推动该研究的关键工具。由于专家时间成本高以及标注者之间难以达成一致,生成这些标准具有挑战性。我们实施并评估了一种微任务众包方法,该方法能产生用于抽取药物-疾病关系的黄金标准。聚合的众包判断在测试的60个句子中有43个与已有语料库中的专家标注一致。众包一致性的水平以与原始专家标注者之间一致性水平相似的方式变化。本工作强化了众包在关系抽取黄金标准组装过程中的力量。此外,它突出了在黄金标准语料库中暴露人类标注者(专家或众包)之间一致性水平的重要性,因为这些是可复现的信号,指示了数据或标注指南中的歧义。
引用
@article{arxiv.1505.06256,
title = {Exposing ambiguities in a relation-extraction gold standard with crowdsourcing},
author = {Tong Shu Li and Benjamin M. Good and Andrew I. Su},
journal= {arXiv preprint arXiv:1505.06256},
year = {2015}
}
备注
4 pages, 3 figures In: Bio-Ontologies SIG, ISMB: 10 July 2015, Dublin