中文

COMETA:面向社交媒体中医学术语链接的语料库

计算与语言 2020-10-09 v2

摘要

尽管通用语言中的实体链接(EL)已取得日益增多的进展,现有数据集仍未能应对通俗语言中健康术语的复杂性。与此同时,能够理解健康领域公众声音的应用需求正不断增长。为此,我们引入名为 COMETA 的新语料库,包含来自 Reddit 的 20k 条英文生物医学实体提及,由专家标注并链接至广泛使用的医学知识图谱 SNOMED CT。我们的语料库满足了规模、覆盖度、多样性与质量相结合的合意特性,据我们所知,现有领域中任何资源均未同时满足这些特性。通过对从基于字符串到基于神经网络的 20 个 EL 基线模型的基准实验,我们揭示了这些系统在两种具挑战性的评估场景下对实体与概念进行复杂推断的能力。我们在 COMETA 上的实验结果表明,不存在万能方案,即便最佳主流技术仍有显著性能差距待弥补,而最佳解决方案依赖于结合数据的不同视角。

关键词

引用

@article{arxiv.2010.03295,
  title  = {COMETA: A Corpus for Medical Entity Linking in the Social Media},
  author = {Marco Basaldella and Fangyu Liu and Ehsan Shareghi and Nigel Collier},
  journal= {arXiv preprint arXiv:2010.03295},
  year   = {2020}
}

备注

Accepted to EMNLP 2020