基于深度学习的 NLP 数据流水线用于电子健康档案扫描文档信息抽取
计算与语言
2021-10-25 v1 计算机视觉与模式识别
摘要
电子健康档案(EHR)中的扫描文档数十年来一直是个挑战,并且在可预见的未来仍将持续。当前的处理方法通常包括图像预处理、光学字符识别(OCR)和文本挖掘。然而,评估图像预处理方法的选择、NLP 模型的选取以及文档版面的作用的工作有限。各要素的影响仍属未知。我们在一个用例上评估了该方法:从扫描的睡眠研究报告中提取睡眠呼吸暂停的两个关键指标,即呼吸暂停低通气指数(AHI)和氧饱和度(SaO2)值。我们的数据包含 955 份人工标注的报告,二次利用自德克萨斯大学医学分部的一项先前研究。我们进行了图像预处理:灰度化后接一次膨胀与腐蚀迭代,以及 20% 对比度增强。OCR 使用 Tesseract OCR 引擎实现。评估了共七种词袋模型(逻辑回归、岭回归、Lasso 回归、支持向量机、k-近邻、朴素贝叶斯和随机森林)和三种基于深度学习的模型(BiLSTM、BERT 和 Clinical BERT)。我们还评估了图像预处理方法(灰度化、膨胀与腐蚀、20% 对比度增强、60% 对比度增强)的组合,以及两种深度学习架构(带和不带提供文档版面信息的结构化输入)。我们提出的使用 Clinical BERT 的方法对 AHI 达到了 0.9743 的 AUROC 和 94.76% 的文档准确率,对 SaO2 达到了 0.9523 的 AUROC 和 91.61% 的文档准确率。我们证明了合理使用图像预处理和文档版面有益于扫描文档处理。
引用
@article{arxiv.2110.11864,
title = {Deep learning-based NLP Data Pipeline for EHR Scanned Document Information Extraction},
author = {Enshuo Hsu and Ioannis Malagaris and Yong-Fang Kuo and Rizwana Sultana and Kirk Roberts},
journal= {arXiv preprint arXiv:2110.11864},
year = {2021}
}
备注
6 tables, 7 figures