基于证据集成语言智能体的人类- AI 共同推理用于临床诊断
摘要
我们提出了PULSE,一种医学推理智能体,将领域调优的大型语言模型与科学文献检索相结合,以支持复杂真实病例的诊断决策。为评估其能力,我们精选了82例真实内分泌科病例报告,涵盖广泛的疾病类型和发生率水平。在受控实验中,我们将 PULSE 的性能与不同水平的医师进行比较——从住院医师到资深专家——并检查了 AI 辅助如何影响人类诊断推理。PULSE 实现了接近专家水平的准确率,超越了住院医师和初级专家,而在 Top@1 和 Top@4 阈值上与资深专家持平。与医师不同,PULSE 在疾病稀有性方面表现出稳定的准确率。该智能体还表现出自适应推理,随病例难度增加而增加输出长度,类似于专家临床医师所观察到的延长思考时间。就协作使用而言,PULSE 使医师能够纠正初始错误并拓宽诊断假设,但也引入了自动偏见的风险。该研究探讨了串行和并行协作工作流程,表明 PULSE 在常见和罕见表现形式中都提供了稳健的支持。这些发现凸显了基于语言模型的智能体在临床诊断中的潜力与局限性,并为评估其在真实世界决策中的作用提供了框架。
引用
@article{arxiv.2603.10492,
title = {Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent},
author = {Zhongzhen Huang and Yan Ling and Hong Chen and Ye Feng and Li Wu and Linjie Mu and Shaoting Zhang and Xiaofan Zhang and Kun Qian and Xiaomu Li},
journal= {arXiv preprint arXiv:2603.10492},
year = {2026}
}
备注
After further evaluation, we have decided to withdraw the current version of this manuscript for further revision. We plan to add new experiments, improve the writing and overall presentation for greater clarity and coherence, and re-examine the dataset and related descriptions to ensure rigor and reliability before submitting an updated version