面向临床数据抽取的多模态管线:将视觉语言模型应用于输血反应报告扫描件
计算与语言
2025-04-30 v1 计算机视觉与模式识别
摘要
尽管电子健康记录的采用日益增长,但许多流程仍依赖纸质文档,反映出医疗保健服务实际应用中所呈现的异构性。手工转录过程在将基于纸张的数据转移到数字格式时耗时且容易出错。为简化此工作流程,本研究提出一种开源管线,用于从扫描文档中提取并分类单选框数据。该方法以输血反应报告为演示案例,设计支持适配其他单选框丰富的文档类型。该方法将整合单选框检测、多语言光学字符识别(OCR)和多语言视觉语言模型(VLM)。该管线在精度和召回率上与 2017 年至 2024 年编制的金标准进行了比较,实现了显著的行政工作负荷减少和准确的监管报告。该管线的开源性质鼓励对单选框表单进行自托管解析。
引用
@article{arxiv.2504.20220,
title = {A Multimodal Pipeline for Clinical Data Extraction: Applying Vision-Language Models to Scans of Transfusion Reaction Reports},
author = {Henning Schäfer and Cynthia S. Schmidt and Johannes Wutzkowsky and Kamil Lorek and Lea Reinartz and Johannes Rückert and Christian Temme and Britta Böckmann and Peter A. Horn and Christoph M. Friedrich},
journal= {arXiv preprint arXiv:2504.20220},
year = {2025}
}