跨越领域鸿沟:从 MIMIC-III 到妇产科的监督式与零样本临床章节分段
计算与语言
2026-04-28 v2
摘要
临床免费文本笔记包含关键患者信息。它们被结构化为标记章节;识别这些章节已被证明可支持临床决策和下游 NLP 任务。在本文中,我们通过三个关键贡献推进临床章节分段。首先,我们策划了一个新的去标识化、带章节标签的妇产科笔记数据集,以补充公开语料库如 MIMIC-III 中已覆盖的医学领域,上述大多数现有分段方法都在其上训练。其次,我们系统评估了针对临床章节分段的基于 transformer 的监督模型,分别在筛选后的 MIMIC-III 子集上(领域内),以及在新的妇产科数据集上(领域外)。最后,我们进行了监督模型与零样本大型语言模型在医学章节分段中的首次对比实验。我们的结果表明,虽然监督模型在领域内表现强劲,但在领域外性能显著下降。相比之下,零样本模型在纠正幻觉章节标题后,展现出稳健的领域外适应性。这些发现凸显了开发针对特定临床资源的重要性,并表明只要妥善管理幻觉,零样本分段是将 healthcare NLP 应用于超出已研究语料库的有前景的方向。
引用
@article{arxiv.2602.17513,
title = {Bridging the Domain Divide: Supervised vs. Zero-Shot Clinical Section Segmentation from MIMIC-III to Obstetrics},
author = {Baris Karacan and Barbara Di Eugenio and Patrick Thornton},
journal= {arXiv preprint arXiv:2602.17513},
year = {2026}
}
备注
14 pages. Camera-ready version accepted at LREC 2026; includes minor revisions and an appendix. To appear in the conference proceedings