临床自然语言处理中公开可用语言任务的范围综述
计算与语言
2021-12-14 v1 人工智能
摘要
目的:对使用来自患者队列的公开可用电子健康记录数据的临床自然语言处理(NLP)任务论文进行范围综述。材料与方法:我们检索了六个数据库,包括生物医学研究和计算机科学文献数据库。由两名评审员进行一轮标题/摘要筛选和全文筛选。我们的方法遵循系统综述与荟萃分析优先报告条目(PRISMA)指南。结果:2007 至 2021 年间共有 35 篇论文、47 项临床 NLP 任务符合纳入标准。我们按 NLP 问题类型对任务进行分类,包括命名实体识别、摘要生成及其他 NLP 任务。部分任务以临床决策支持应用为主题引入,如药物滥用、表型分析、临床试验队列筛选。我们按发表信息和数据集信息对任务进行总结。讨论:随着 NLP 领域随语言系统进展而演进,临床 NLP 任务的广度持续扩大。然而,通用领域 NLP 社区与临床信息学社区之间兴趣分歧以及数据源的泛化性方面存在差距。我们还识别出数据选择与准备中的问题,包括缺乏时间敏感数据,以及问题规模与评估的无效性。结论:现有临床 NLP 任务涵盖广泛主题,该领域将持续增长并吸引通用领域 NLP 与临床信息学社区的更多关注。我们鼓励未来工作纳入多学科协作、报告透明性以及数据准备的标准化。
引用
@article{arxiv.2112.05780,
title = {A Scoping Review of Publicly Available Language Tasks in Clinical Natural Language Processing},
author = {Yanjun Gao and Dmitriy Dligach and Leslie Christensen and Samuel Tesch and Ryan Laffin and Dongfang Xu and Timothy Miller and Ozlem Uzuner and Matthew M Churpek and Majid Afshar},
journal= {arXiv preprint arXiv:2112.05780},
year = {2021}
}
备注
Paper submitted to Journal of American Medical Informatics Association (JAMIA)