中文

从文本中进行本体 enrichment:用于概念发现与放置的生物医学数据集

计算与语言 2023-09-04 v3

摘要

新概念的提及定期出现在文本中,需要自动化方法将其提取并放入知识库(KB)(例如本体和分类法)中。现有数据集存在三个问题:(i) 大多假设新概念已被预先发现,无法支持 KB 外提及发现;(ii) 仅使用概念标签作为 KB 的输入,因而缺乏概念标签的上下文;(iii) 大多关注针对原子概念分类法的概念放置,而非复杂概念(即带逻辑运算符的概念)。为解决这些问题,我们提出一个新基准,基于 MedMentions 数据集(PubMed 摘要)并采用 2014 和 2017 版 SNOMED CT,限于疾病子类别以及临床发现、操作、药物/生物制品等更广类别。我们提供了利用该数据集进行 KB 外提及发现和概念放置的评估用法,并适配了近期基于大语言模型(LLM)的方法。

关键词

引用

@article{arxiv.2306.14704,
  title  = {Ontology Enrichment from Texts: A Biomedical Dataset for Concept Discovery and Placement},
  author = {Hang Dong and Jiaoyan Chen and Yuan He and Ian Horrocks},
  journal= {arXiv preprint arXiv:2306.14704},
  year   = {2023}
}

备注

5 pages, 1 figure, accepted for CIKM 2023. The dataset, data construction scripts, and baseline implementation are available at https://zenodo.org/record/8228005 (Zenodo) and https://github.com/KRR-Oxford/OET (GitHub)