中文

大语言模型在实验室检验解读的临床情景化场景中的因果推理评估

人工智能 2025-09-23 v1

摘要

本研究使用 99 个符合 Pearl 因果阶梯(关联、干预和反事实推理)的临床实验室检验场景,评估了大语言模型(LLM)的因果推理能力。我们检查了常见的实验室检验,如血红蛋白 A1c、肌酐和维生素 D,并将它们与年龄、性别、肥胖和吸烟等相关因果因素配对。测试了两个 LLM——GPT-o1 和 Llama-3.2-8b-instruct,其回答由四位经过医学训练的人类专家进行评估。GPT-o1 表现出更强的判别性能(总体 AUROC = 0.80 +/- 0.12),相比之下 Llama-3.2-8b-instruct 为 0.73 +/- 0.15,在关联(0.75 vs 0.72)、干预(0.84 vs 0.70)和反事实推理(0.84 vs 0.69)方面得分更高。GPT-o1 的敏感性(0.90 vs 0.84)和特异性(0.93 vs 0.80)也更高,推理评分显示出相似的趋势。两个模型在干预问题上表现最好,在反事实问题上表现最差,尤其是在结果改变的场景中。这些发现表明 GPT-o1 提供了更一致的因果推理,但在高风险临床应用中采用之前仍需改进。

关键词

引用

@article{arxiv.2509.16372,
  title  = {Evaluation of Causal Reasoning for Large Language Models in Contextualized Clinical Scenarios of Laboratory Test Interpretation},
  author = {Balu Bhasuran and Mattia Prosperi and Karim Hanna and John Petrilli and Caretia JeLayne Washington and Zhe He},
  journal= {arXiv preprint arXiv:2509.16372},
  year   = {2025}
}