中文

DeVisE:医疗大语言模型的行为测试

计算与语言 2026-02-27 v3

摘要

大语言模型(LLM)越来越多地应用于临床决策支持,然而当前的评估很少揭示其输出反映的是真正的医学推理还是表面相关性。我们引入了DeVisE(Demographics and Vital signs Evaluation),这是一个行为测试框架,通过受控反事实探测细粒度的临床理解。使用MIMIC-IV的重症监护室(ICU)出院记录,我们构建了原始(真实世界)和基于模板(合成)的变体,并在人口统计学(年龄、性别、种族)和生命体征属性上进行单变量扰动。我们在零样本设置下评估了八个LLM,涵盖通用和医疗变体。模型行为通过以下两方面进行分析:(1)输入级敏感性,捕捉反事实如何改变困惑度;(2)下游推理,衡量其对预测ICU住院时长和死亡率的影响。总体而言,我们的结果表明,标准任务指标掩盖了模型行为中具有临床相关性的差异,不同模型在将预测调整以适应反事实扰动的一致性和比例性方面存在显著差异。

关键词

引用

@article{arxiv.2506.15339,
  title  = {DeVisE: Behavioral Testing of Medical Large Language Models},
  author = {Camila Zurdo Tagliabue and Heloisa Oss Boll and Aykut Erdem and Erkut Erdem and Iacer Calixto},
  journal= {arXiv preprint arXiv:2506.15339},
  year   = {2026}
}

备注

Camera-ready version published at Findings of the EACL 2026