自动检测临床文档版式以提升下游自然语言处理性能
计算与语言
2023-05-24 v1
摘要
目的:开发并验证一种用于分析PDF临床文档版式以提升下游自然语言处理任务性能的算法。材料与方法:我们设计了一种处理临床PDF文档并仅提取临床相关文本的算法。该算法包含若干步骤:首先使用PDF解析器进行初始文本提取,随后使用Transformer深度神经网络架构分类为正文、左侧批注与页脚等类别,最后通过聚合步骤编译给定标签的文本行。我们通过对标注文档的随机样本应用该算法来评估正文提取算法的技术性能。通过考察各自章节中感兴趣医学概念的提取来评估医学性能。最后,我们在医院报告中急性感染自动检测的医疗用例上测试了端到端系统。结果:我们的算法在正文行提取上逐行精确率、召回率与F1分数分别为98.4、97.0与97.7。急性感染检测算法在利用高级正文提取算法结果后,逐文档精确率、召回率与F1分数为82.54(95CI 72.86-91.60)、85.24(95CI 76.61-93.70)、83.87(95CI 76, 92-90.08)。结论:我们开发并验证了一种通过识别版式从PDF格式临床文档中提取正文的系统。我们能够证明该预处理使我们在一个常见下游任务(即各自章节中医学概念提取)上获得更优性能,从而证明了该方法在临床用例上的价值。
引用
@article{arxiv.2305.13817,
title = {Detecting automatically the layout of clinical documents to enhance the performances of downstream natural language processing},
author = {Christel Gérardin and Perceval Wajsbürt and Basile Dura and Alice Calliger and Alexandre Moucher and Xavier Tannier and Romain Bey},
journal= {arXiv preprint arXiv:2305.13817},
year = {2023}
}
备注
22 pages, 5 figures