DEXTER:一种从电子医疗健康文档中提取表格内容的端到端系统
计算机视觉与模式识别
2022-07-19 v2
摘要
在本文中,我们提出 DEXTER,一种用于从医疗健康文档(如电子健康记录(EHR)和福利说明(EOB))中存在的表格提取信息的端到端系统。DEXTER 由四个子系统阶段组成:i)表格检测;ii)表格类型分类;iii)单元格检测;iv)单元格内容提取。我们提出一种基于两阶段迁移学习的方法,使用 CDeC-Net 架构并结合非极大抑制(Non-Maximal suppression)进行表格检测。我们设计了一种基于传统计算机视觉的方法,利用基于图像大小参数化的核来检测行和列,用于表格类型分类和单元格检测。最后,我们使用已有的 OCR 引擎 Tessaract 从检测到的单元格中提取文本。为评估我们的系统,我们手动标注了真实世界医疗数据集(称为 Meddata)的样本,该数据集包含外观差异很大的文档,涵盖不同的表格结构,如带边框、部分边框、无边框或彩色表格。我们通过实验表明,在标注的真实世界医疗数据集上,DEXTER 优于商业可用的 Amazon Textract 和 Microsoft Azure Form Recognizer 系统。
引用
@article{arxiv.2207.06823,
title = {DEXTER: An end-to-end system to extract table contents from electronic medical health documents},
author = {Nandhinee PR and Harinath Krishnamoorthy and Koushik Srivatsan and Anil Goyal and Sudarsun Santhiappan},
journal= {arXiv preprint arXiv:2207.06823},
year = {2022}
}