中文

大语言模型在智能体临床推理中的信息寻求失败

人工智能 2026-07-11 v1 计算与语言

摘要

大语言模型在医学知识评估中取得高分,但临床推理需要主动决定在不确定性下调查什么。我们开发了一个血液肿瘤学的智能体评估框架,在该框架中,模型必须在提交诊断和治疗计划之前,主动请求跨三个连续轮次的临床数据。在32个前沿模型中,最好的模型也只达到了68%的总体准确率。信息利用率,即实际请求的可用数据的比例,是诊断准确率的最强预测因子(R = 0.69, P < 0.001),然而利用率在最后一轮从57%下降到26%,导致对治疗选择至关重要的分子和细胞遗传学数据未被检查。推理轨迹在临床推理评分标准上得分很高(91%超过阈值),但与准确率不相关,揭示了局部连贯的推理与全局正确的结论之间的差距。错误分析确定搜索满足、锚定和过早结束是主要的失败模式,这与双过程诊断推理模型下新手临床医生的认知偏倚相同。这些发现表明,当前模型在临床肿瘤学中的主要限制不是医学知识不足,而是在不确定性下系统性的信息寻求失败。

关键词

引用

@article{arxiv.2607.10275,
  title  = {Information-seeking failures of large language models in agentic clinical reasoning},
  author = {Krischan Braitsch and Laura K. Schmalbrock and Theresa Weltermann and Andrew F. Berdel and Isabella Miller and Kai Tran and Michael Heider and Sabrina Kraus and Florian Bassermann and Jacqueline Lammert and Sebastian Ziegelmayer and Marcus Makowski and Lisa C. Adams and Keno K. Bressem},
  journal= {arXiv preprint arXiv:2607.10275},
  year   = {2026}
}

备注

66 pages, 9 figures; includes supplementary material