面向术后出院临床行动抽取的大型语言模型系统评估
人工智能
2026-05-08 v1
摘要
本文评估了零-shot 和 few-shot 大型语言模型(LLM)用于安全关键的临床行动抽取,使用 CLIP 出院记录数据集,特别关注出院后护理转换和患者安全。为管理临床文档的复杂性,我们引入了一个两阶段抽取框架,将以叙述性形式书写的出院记录分解为细粒度、显式可操作的临床任务,通过分阶段提示策略实现。我们的贡献包括:系统评估生成式 LLM 用于临床行动抽取,详细比较通用 LLM 与面向任务的监督 BERT 模型,以及分析不同行动类别之间的标注不一致性。我们表明,当代 LLM 在二元可操作性检测上实现了相当于或超过监督模型的性能,而监督基线在细粒度多标签类别分类中仍保持有意义的优势,尽管缺乏任务特定的微调,并在严格的数据隐私约束下实现。定性错误分析揭示,许多失败源于模型推理与数据集标注约定之间的错位,特别是在涉及隐式临床行动和刚性结构标注规则的情况下。这些结果表明,报告的性能反映了模型由于缺乏临床推理能力而存在的局限性,这种局限性并未被纯粹的标注所捕捉。没有理由的标签不可能区分临床推理失败与标注约定不匹配。推进临床 NLP 需要推理标注数据集,这类数据集记录特定文本片段为何可操作,而不仅仅是哪些片段被标注,从而实现对模型临床理解的proper evaluation。
引用
@article{arxiv.2605.06191,
title = {Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction},
author = {Shivali Dalmia and Ananya Mantravadi and Prasanna Desikan},
journal= {arXiv preprint arXiv:2605.06191},
year = {2026}
}