中文

ClinDEF:面向临床推理的大语言模型动态评估框架

计算与语言 2025-12-30 v1

摘要

临床诊断始于医生与患者的互动,医生在此过程中不断收集信息,确定检查项目并通过患者的反应来细化诊断思路。这种动态的临床推理过程在现有 LLM 基准测试中难以准确地表示,这些基准测试侧重于静态问答。为缓解这些差距,最近的方法探索了涉及交互式临床对话的动态医学框架。尽管这些方法有效,但往往依赖有限且易受污染的数据集,且缺乏细粒度的、多层次的评估。在本工作中,我们提出 ClinDEF,这是一个通过模拟诊断对话来评估临床推理的动态框架。我们的方法基于疾病知识图谱,动态生成患者病例,促进基于 LLM 的医生与自动化患者代理之间多轮交互。我们的评估协议不仅包括诊断准确率,还包含细粒度的效率分析和基于评分标准的诊断质量评估。实验表明,ClinDEF 能够有效暴露最新 LLMs 在临床推理方面的关键缺陷,提供一种更为细致且在临床上有意义的评估范式。

关键词

引用

@article{arxiv.2512.23440,
  title  = {ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning},
  author = {Yuqi Tang and Jing Yu and Zichang Su and Kehua Feng and Zhihui Zhu and Libin Wang and Lei Liang and Qiang Zhang and Keyan Ding and Huajun Chen},
  journal= {arXiv preprint arXiv:2512.23440},
  year   = {2025}
}

备注

23 pages, 4 figures, under review