中文

医学实体抽取的 conformal 预测:面向临床领域的风险可控框架

计算与语言 2026-03-10 v2 人工智能

摘要

大语言模型(LLM)广泛用于医学实体抽取,但其置信度评分常不准确,限制了在临床场景中的安全部署。我们提出一种conformal预测框架,为LLM-based抽取提供有限样本覆盖保障,适用于两个临床领域。首先,我们使用GPT-4.1从1000份FDA药品标签中抽取结构化实体(覆盖8个章节),通过FactScore-based 原子语句评估进行验证(128,906个实体准确率达97.7%)。其次,我们使用GPT-4.1与Llama-4-Maverick从MIMIC-CXR报告中抽取放射学实体,采用RadGraph模式,评估依据医生标注(实体F1分数在0.81至0.84)。核心发现:不同领域中模型的误校准方向相反——在结构化FDA标签上,模型偏保守(需较小阈值τ≈0.06),而在自由文本放射学报告上,模型偏乐观(需严格阈值τ最高达0.99)。尽管存在这种异质性,conformal预测在两种场景中均实现≥90%的目标覆盖率,拒绝率控制在9%至13%之间。结果表明,校准并非模型的全局属性,而是取决于文档结构、抽取类别及模型架构,此发现推动了面向安全临床部署的领域特定conformal校准。

关键词

引用

@article{arxiv.2603.00924,
  title  = {Conformal Prediction for Risk-Controlled Medical Entity Extraction Across Clinical Domains},
  author = {Manil Shrestha and Edward Kim},
  journal= {arXiv preprint arXiv:2603.00924},
  year   = {2026}
}