开发基于可移植自然语言处理的表型系统
计算与语言
2018-07-19 v1 信息检索
摘要
本文提出一种可移植的表型系统,能够集成基于规则和基于统计机器学习的方法。我们的系统利用 UMLS 从非结构化文本中提取临床相关特征,随后通过采用 OHDSI 的 OMOP 通用数据模型(CDM)标准化必要数据元素,以促进跨不同机构与数据系统的可移植性。我们的系统还可将基于规则系统的关键组件(例如正则表达式匹配)以 OMOP CDM 的格式存储,从而实现对许多现有基于规则的临床 NLP 系统的复用、适配与扩展。我们以 i2b2 肥胖挑战赛的语料作为试点研究对我们的系统进行了实验。我们的系统基于非结构化患者出院小结实现了肥胖及其 15 种共病的可移植表型分析,同时取得了常跻身挑战赛参与者前 10 名的性能。这种标准化使得众多基于规则和机器学习的分类技术能够在下游得到一致应用。
引用
@article{arxiv.1807.06638,
title = {Developing a Portable Natural Language Processing Based Phenotyping System},
author = {Himanshu Sharma and Chengsheng Mao and Yizhen Zhang and Haleh Vatani and Liang Yao and Yizhen Zhong and Luke Rasmussen and Guoqian Jiang and Jyotishman Pathak and Yuan Luo},
journal= {arXiv preprint arXiv:1807.06638},
year = {2018}
}
备注
13 pages