面向基于 EHR 的临床研究的开放自然语言处理开发框架:以国家 COVID 队列协作(N3C)为例的演示
计算与语言
2022-03-23 v3 信息检索
摘要
在关注临床自然语言处理(NLP)最新进展的同时,我们注意到临床与转化研究界因透明度、可解释性与可用性有限而对采用 NLP 模型存在一定阻力。本研究中,我们提出了一种开放的自然语言处理开发框架。我们通过为国家 COVID 队列协作(N3C)实现 NLP 算法对其进行了评估。基于从 COVID-19 相关临床笔记中抽取信息的关注,我们的工作包括:1)以 COVID-19 体征与症状为用例的开放数据标注流程,2)社区驱动的规则集编写平台,以及 3)在不涉及人类受试者的情况下为信息抽取任务生成文本的合成文本数据生成工作流。语料来源于三家不同机构(Mayo Clinic、University of Kentucky、University of Minnesota)的文本。金标准标注以单一机构(Mayo)的规则集进行测试,在 Mayo、Minnesota 与 Kentucky 测试数据集上分别取得 0.876、0.706 与 0.694 的 F 值性能。作为 N3C NLP 小组的联盟努力,本研究展示了创建联邦式 NLP 算法开发与基准测试平台以促进多机构临床 NLP 研究与应用的可行性。尽管我们以 COVID-19 为用例,我们的框架具有足够的通用性,可应用于临床 NLP 中其他关注领域。
引用
@article{arxiv.2110.10780,
title = {An Open Natural Language Processing Development Framework for EHR-based Clinical Research: A case demonstration using the National COVID Cohort Collaborative (N3C)},
author = {Sijia Liu and Andrew Wen and Liwei Wang and Huan He and Sunyang Fu and Robert Miller and Andrew Williams and Daniel Harris and Ramakanth Kavuluru and Mei Liu and Noor Abu-el-rub and Dalton Schutte and Rui Zhang and Masoud Rouhizadeh and John D. Osborne and Yongqun He and Umit Topaloglu and Stephanie S Hong and Joel H Saltz and Thomas Schaffter and Emily Pfaff and Christopher G. Chute and Tim Duong and Melissa A. Haendel and Rafael Fuentes and Peter Szolovits and Hua Xu and Hongfang Liu and National COVID Cohort Collaborative and Natural Language Processing and Subgroup and National COVID Cohort Collaborative},
journal= {arXiv preprint arXiv:2110.10780},
year = {2022}
}
备注
update on contents