CNSight: 临床记录分割工具的评估
计算与语言
2025-12-30 v1 人工智能
机器学习
摘要
临床记录从电子病历(EMR)系统中提取后,通常以非结构化或半结构化格式存储,这使其难以用于二次分析和下游临床应用。可靠地识别章节边界是结构化这些记录的关键步骤,因为现病史、用药和出院指导等章节各自提供了不同的临床背景。在本研究中,我们使用来自 MIMIC-IV 的 1,000 份精选记录数据集,评估了基于规则的基线方法、特定领域的 Transformer 模型以及大语言模型在临床记录分割中的表现。我们的实验表明,基于 API 的大模型取得了最佳的整体性能,其中 GPT-5-mini 在句子级和自由文本分割中达到了 72.4 的最佳平均 F1 分数。轻量级基线方法在结构化的句子级任务中仍具竞争力,但在非结构化的自由文本上表现不佳。我们的结果为方法选择提供了指导,并为信息提取、队列识别和自动摘要等下游任务奠定了基础。
引用
@article{arxiv.2512.22795,
title = {CNSight: Evaluation of Clinical Note Segmentation Tools},
author = {Risha Surana and Adrian Law and Sunwoo Kim and Rishab Sridhar and Angxiao Han and Peiyu Hong},
journal= {arXiv preprint arXiv:2512.22795},
year = {2025}
}