利用证据导向的大语言模型提升抑郁诊断的可信度
人工智能
2025-11-25 v1 信息检索
摘要
大语言模型(LLM)在临床诊断自动化方面显示出巨大的潜力,但其非透明的决策过程和与诊断标准的有限对齐,仍阻碍了其可信度和临床应用。我们提出了两个阶段的诊断框架,以提升透明度、可信度和可靠性。首先,我们引入证据导向诊断推理(EGDR),该方法通过在提取证据与基于 DSM-5 标准进行逻辑推理之间交替进行,引导 LLM 生成结构化的诊断假设。其次,我们提出了诊断置信度评分(DCS)模块,通过两个可解释的指标——知识归因得分(KAS)和逻辑一致性得分(LCS)——来评估生成诊断的事实准确性和逻辑一致性。在 D4 数据集上进行伪标签评估后,EGDR 在五个 LLM 上均优于直接的 in-context 提示和链式思维(Chain-of-Thought, CoT)方法。例如,在 OpenBioLLM 上,EGDR 将准确率从 0.31 提升至 0.76,DCS 从 0.50 提升至 0.67。在 MedLlama 上,DCS 从 0.58 提升至 0.77。总体而言,EGDR 相较于基线方法可实现最高达 +45% 的准确率提升和 +36% 的 DCS 提升,为可信赖的 AI 辅助诊断提供了以临床为导向、可解释的基础。
引用
@article{arxiv.2511.17947,
title = {Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis},
author = {Yining Yuan and J. Ben Tamo and Micky C. Nnamdi and Yifei Wang and May D. Wang},
journal= {arXiv preprint arXiv:2511.17947},
year = {2025}
}