中文

临床医生输入引导前沿 AI 模型实现准确且有害的决策

人机交互 2026-03-17 v1 机器学习

摘要

大型语言模型(LLM)正进入临床医生的工作流程,但评估极少衡量临床推理如何在临床交互期间塑造模型行为。我们将 61 篇《新英格兰医学杂志》病例记录与 92 例真实临床医生-AI 交互相结合,对 21 种推理 LLM 变体在 8 个前沿模型上进行评估,针对差异诊断生成和下一步建议,在三种条件下进行:仅推理、在专家临床背景后、在对抗性临床背景后。LLM 临床医生一致性在暴露给临床医生后显著提升,分享 >=3 项差异诊断项目的模拟从 65.8% 上升至 93.5%,>=3 项下一步建议从 20.3% 上升至 53.8%。专家背景在所有 21 个模型中显著提升最终诊断包含情况(平均提升 20.4 个百分点),反映了推理改进和被动内容回声,而对抗性背景则在 14 个模型中导致显著诊断退化(平均下降 5.4 个百分点)。多轮不一致探针揭示了从高度顺从到固执己见的不同模型表型,对抗性论点仍是持久的脆弱性,即使是其他韧性模型亦然。在 GPT-4o 实验中,明确的临床不确定性信号在对抗性背景后改善了诊断表现(最终诊断包含率从 27% 上升至 42%),并将对错误论证的对齐性降低 21%。这些发现为评估临床-AI 合作奠定了基础,引入essential 的交互式指标和缓解策略。

关键词

引用

@article{arxiv.2603.14158,
  title  = {Clinician input steers frontier AI models toward both accurate and harmful decisions},
  author = {Ivan Lopez and Selin S. Everett and Bryan J. Bunning and April S. Liang and Dong Han Yao and Shivam C. Vedak and Kameron C. Black and Sophie Ostmeier and Stephen P. Ma and Emily Alsentzer and Jonathan H. Chen and Akshay S. Chaudhari and Eric Horvitz},
  journal= {arXiv preprint arXiv:2603.14158},
  year   = {2026}
}