关键覆盖至关重要:OCR 临床报告的半结构化抽取
计算与语言
2026-05-12 v1 人工智能
摘要
由于隐私法规和数据孤岛限制了直接的信息共享,临床报告通常分散在不同的医疗机构中。当患者在其他医院就诊时,通常会携带以往就诊的纸质或扫描报告。这阻碍了 EHR 集成和纵向审查,以及依赖于更完整患者记录的下游应用,如患者管理、随访护理、真实世界研究和临床试验匹配。尽管 OCR 可以将这些报告数字化,但可靠的抽取仍然具有挑战性,因为临床文档具有异构性,OCR 文本存在噪声,且许多医疗环境需要低成本的本地部署。我们将此问题表述为基于规范关键条件的抽取式问答,应用于 OCR 生成的临床报告。由于关键字段既不固定也不预先已知,关键空间是开放的。我们通过迭代关键键挖掘、规范化、聚类和轻量级人工验证来维护规范关键清单,并引入关键覆盖率作为量化清单完整性的指标。使用 0.2B BERT-based 模型,在来自 20 多家医院的真实报告上的实验表明,性能随关键覆盖率的增加而单调提升。一旦覆盖了 Top-90 规范关键键,该模型在精确匹配和容错边界匹配下的 F1 分数分别达到 0.839 和 0.893。这些结果表明,关键覆盖率是端到端性能的主导因素。在 Top-90 覆盖率下,我们的模型在精确匹配下优于微调的 Qwen3-0.6B 基线。尽管我们的标注语料库是中文,但该方法依赖于半结构化临床报告的与语言无关的键值组织,在给定适当的规范关键清单和别名映射时,可适应于其他场景。
引用
@article{arxiv.2605.09440,
title = {Key Coverage Matters: Semi-Structured Extraction of OCR Clinical Reports},
author = {Yu Wang and Yingyun Li and Ying Qin and Haiyang Qian},
journal= {arXiv preprint arXiv:2605.09440},
year = {2026}
}
备注
Preprint. Under review at MLHC 2026