中文

AgentClinic: 用于模拟临床环境中评估AI代理的多模态基准

人机交互 2025-05-27 v5 计算与语言

摘要

评估大型语言模型(LLM)在临床情景中的表现对于 assessing其潜在临床效用至关重要. 现有基准过度依赖静态问答, 无法准确描绘临床决策的复杂且顺序性. 本文介绍AgentClinic, 一个用于在模拟临床环境中评估LLM的多模态代理基准, 包括患者互动、在信息不完整下的多模态数据收集以及各类工具的使用, 从而在九个医学专科和七种语言中进行深入评估. 我们发现, 将MedQA问题以AgentClinic的顺序决策格式化后, 诊断准确率可下降至原准确率的十分之一以下. 总体而言, 我们观察到来自Claude-3.5的代理在大多数情景下优于其他LLM backbone. 然而, 我们看到LLMs利用工具能力存在显著差异, 如经验学习、自适应检索和反思循环. 值得注意的是, Llama-3在使用notebook工具(允许跨案例编写和编辑持久化笔记)时, 可实现最高达92%的相对改进. 为进一步细致评估我们的临床模拟, 我们利用真实电子健康记录、进行临床读者研究、对代理施加偏置, 并探索这种交互式环境首次启用的新型患者中心指标.

关键词

引用

@article{arxiv.2405.07960,
  title  = {AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments},
  author = {Samuel Schmidgall and Rojin Ziaei and Carl Harris and Eduardo Reis and Jeffrey Jopling and Michael Moor},
  journal= {arXiv preprint arXiv:2405.07960},
  year   = {2025}
}