中文

H-DDx:面向差别诊断的层次化评估框架

人工智能 2025-10-07 v1

摘要

准确的差别诊断(DDx)对于患者护理至关重要,决定治疗方案并影响疗效。最近,大型语言模型(LLM)作为支持此过程的工具,能够从患者叙述中生成DDx列表。然而,现有的LLM在此领域的评估主要依赖于平面指标,如Top-k准确率,这些指标无法区分临床相关的接近误差与诊断疏离的错误。为缓解此限制,我们引入H-DDx,一种更贴近临床相关性的层次化评估框架。H-DDx利用检索和重排序管道将自由文本诊断映射到ICD-10编码,并应用层次化指标,对预测结果与真实诊断密切相关的情形给予积分。在对22个领先模型进行基准测试后,我们表明常规的平面指标会忽略临床上有意义的输出,从而低估了性能,我们的结果凸显了领域专业化开源模型的优势。此外,我们的框架通过揭示层次化错误模式来增强可解释性,表明LLM往往即使未能获得精确诊断,也能正确识别更广泛的临床背景。

引用

@article{arxiv.2510.03700,
  title  = {H-DDx: A Hierarchical Evaluation Framework for Differential Diagnosis},
  author = {Seungseop Lim and Gibaeg Kim and Hyunkyung Lee and Wooseok Han and Jean Seo and Jaehyo Yoo and Eunho Yang},
  journal= {arXiv preprint arXiv:2510.03700},
  year   = {2025}
}

备注

GenAI4Health @NeurIPS 2025