临床试验资格标准的信息抽取
计算与语言
2020-07-29 v6
摘要
临床试验将受试者资格建立在从患者人口统计到食物过敏等多种标准之上。试验以语义复杂、非结构化的自由文本形式发布其要求。将试验标准形式化为计算机可解释的语法将有助于资格判定。本文研究了一种信息抽取(IE)方法,用于将 ClinicalTrials(dot)gov 上的试验标准映射到共享知识库。我们将该问题定义为一个新颖的知识库填充任务,并实现了一个结合机器学习和上下文无关文法的解决方案。据我们所知,本工作是首个应用基于注意力机制的条件随机场架构进行命名实体识别(NER),以及应用 word2vec 嵌入聚类进行命名实体链接(NEL)的标准抽取系统。我们在 GitHub 上发布了我们系统的资源和核心组件:https://github.com/facebookresearch/Clinical-Trial-Parser。最后,我们报告了各模块和端到端的性能;我们得出结论,我们的系统与 Criteria2Query 具有竞争力,后者我们视为当前标准抽取领域的最先进水平。
引用
@article{arxiv.2006.07296,
title = {Information Extraction of Clinical Trial Eligibility Criteria},
author = {Yitong Tseo and M. I. Salkola and Ahmed Mohamed and Anuj Kumar and Freddy Abnousi},
journal= {arXiv preprint arXiv:2006.07296},
year = {2020}
}
备注
4 pages