中文

MedPI:评估医学患者互动中AI系统的基准

计算与语言 2026-01-09 v1 人工智能

摘要

我们提出了 MedPI,这是一个用于评估大语言模型(LLM)在患者-医生对话中的高维基准测试。不同于单轮问答(QA)基准测试,MedPI 横跨105个维度,涵盖医疗流程、治疗安全、治疗结果以及医患沟通,基于粒粒细致且符合 accreditation(认证)标准的评估量规。MedPI 包含五层结构:(1)患者数据包(模拟 EHR 类真实数据);(2)通过具备记忆与情感功能的 LLM 实现的 AI 患者;(3)任务矩阵,涵盖就诊原因(如焦虑、孕期、体检)与就诊目标(如诊断、生活建议、用药建议)的组合;(4)评估框架,采用1-4分尺度的105个维度,映射至 accreditation council for graduate medical education(ACGME)资格认证 competencies;(5)AI 评判官,这些经过校准的、基于 committee 的 LLM 提供评分、标记及依据链接的论证。我们在366个 AI 患者、7097次对话中,对9个旗舰模型(Claude Opus 4.1、Claude Sonnet 4、MedGemma、Gemini 2.5 Pro、Llama 3.3 70b Instruct、GPT-5、GPT OSS 120b、o3、Grok-4)进行评估。所有 LLM 在各维度上均表现不佳,尤其是差异诊断方面。我们的工作可帮助指导未来在诊断和治疗建议方面应用 LLM。

关键词

引用

@article{arxiv.2601.04195,
  title  = {MedPI: Evaluating AI Systems in Medical Patient-facing Interactions},
  author = {Diego Fajardo V. and Oleksii Proniakin and Victoria-Elisabeth Gruber and Razvan Marinescu},
  journal= {arXiv preprint arXiv:2601.04195},
  year   = {2026}
}

备注

24 pages, 6 figures