中文

人类-LLM 对话提升急诊诊断准确性

人工智能 2026-05-12 v1

摘要

急诊医学的临床决策需要在不确定性下进行快速、准确的诊断。尽管基准测试取得了进展,但关于LLM作为交互式辅助工具在实际医生工作流程中的证据仍较稀缺。MedSyn 让医生能够迭代查询由完整临床记录提供支持的LLM,同时最初仅查看主诉。七名医生(三名资深医生、四名住院医生)完成了基于困难度分层的52个 MIMIC-IV 案例的基线和AI辅助会话。盲目评估显示,住院医生的难题正确率从0.589提升至0.734;难度标准化的完全正确率确认了中等效应({\Delta} = 0.092; p = 0.071; d = 0.47)。自动化指标也证实了这些收益:标准化任意匹配准确率提高了0.156(p < 0.0001),住院医生显示出最大的F1增益({\Delta} = 0.138; p < 0.0001)。对话分析揭示了专业水平依赖性的策略(资深医生提出针对性、假设驱动的问题;住院医生依赖更广泛的查询),并且跨专业水平的一致性提高了{\Delta} = 0.145(p < 0.0001)。交互式LLM支持在实质性地提高了诊断推理。

关键词

引用

@article{arxiv.2605.08533,
  title  = {Human-LLM Dialogue Improves Diagnostic Accuracy in Emergency Care},
  author = {Burcu Sayin and Ngoc Vo Hong and Ipek Baris Schlicht and Jacopo Staiano and Pasquale Minervini and Sara Allievi and Nicola Susca and Nicola Osti and Alberto Maino and Vito Racanelli and Andrea Passerini},
  journal= {arXiv preprint arXiv:2605.08533},
  year   = {2026}
}

备注

Paper under review