MedArena:面向临床医生偏好的 LLM 医学比较评估
计算与语言
2026-03-18 v1
摘要
大型语言模型 (LLM) 正在临床工作流程中发挥越来越重要的作用,涵盖临床决策支持、医学教育和患者沟通等领域。然而,当前针对医学 LLM 的评估方法仍依赖静态模板化基准,无法捕捉真实世界临诊实践的复杂性和动态性,导致基准表现与临床实用性之间存在差距。为此,我们提出了 MedArena,一个交互式评估平台,使临床医生能够直接使用自己的医学查询测试和比较领先的 LLM。给定临床医生提供的查询后,MedArena 随机选择两个模型并呈现其响应,要求用户选择更佳的响应。截至 2025 年 11 月 1 日,收集了 1571 条偏好数据,涵盖 12 个 LLM。按布拉德利-蒂利评级,Gemini 2.0 Flash Thinking、Gemini 2.5 Pro 和 GPT-4o 位居前三。仅有约三分之一的临床医生提交的问题类似于事实记忆任务(如 MedQA),而绝大多数则涉及治疗选择、临床文档或患者沟通,其中约 20% 涉及多轮对话。此外,临床医生更常引用深度和细节以及呈现清晰度,而非原始事实准确性来解释偏好,凸显了可读性和临床细微差别的重要性。我们也确认,在控制响应长度和格式等风格因素后,模型排名保持稳定。通过以真实世界临床问题和偏好为基础,MedArena 提供了一个可扩展的平台,用于衡量和改进医学 LLM 的实用性和效果。
引用
@article{arxiv.2603.15677,
title = {MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences},
author = {Eric Wu and Kevin Wu and Jason Hom and Paul H. Yi and Angela Zhang and Alejandro Lozano and Jeff Nirschl and Jeff Tangney and Kevin Byram and Braydon Dymm and Narender Annapureddy and Eric Topol and David Ouyang and James Zou},
journal= {arXiv preprint arXiv:2603.15677},
year = {2026}
}