面向OCR临床报告的MedStruct-S基准:关键发现、关键条件QA与准结构化提取
计算与语言
2026-05-06 v1 人工智能
机器学习
摘要
从OCR衍生的临床报告中进行准结构化信息提取对于高效重建患者的纵向医疗史至关重要。在实际应用中,这一场景通常涉及三个任务:(i) 字段标题(关键词)发现、(ii) 关键词条件问答(QA)、(iii) 端到端关键词值对提取。然而,现有评估常常未能充分建模两个因素:异构且不完整已知的关键词表示,以及OCR引入的噪声。这使得难以评估模型在现实场景下的鲁棒性。我们提出MedStruct-S基准,专为在未知关键词和OCR噪声下评估这些任务而设计。MedStruct-S包含3,582个标注的真实临床报告页面。使用MedStruct-S,我们基准测试了两种代表性方法:基于后处理的编码器-only序列标注和解码器-only结构生成,覆盖4个编码器-only模型和5个解码器-only模型,参数规模从0.11B到103B。我们的结果表明,尽管编码器-only模型在非空值关键词条件QA任务中性能最佳,但其规模显著小于解码器-only模型。在相近规模模型之间进行比较时,编码器-only模型仍整体性能更佳。若不控制模型规模,微调后的解码器-only模型提供最强的总体结果。这些发现表明,该基准为在不同半结构化信息提取场景中选择和比较模型提供了可靠且实用的依据。
引用
@article{arxiv.2605.03103,
title = {MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports},
author = {Yingyun Li and Yu Wang and Haiyang Qian},
journal= {arXiv preprint arXiv:2605.03103},
year = {2026}
}
备注
11 pages, 5 figures. Accepted by KSEM 2026. This is the author's preprint version; the final authenticated version will be available in the Springer LNCS/LNAI proceedings