中文

BRIDGE:面向临床实践文本的大语言模型基准测试

计算与语言 2026-03-31 v4 人工智能

摘要

大语言模型(LLMs)在医疗领域具有巨大的应用前景,正以加速的速度推出新模型。然而,对基于大规模真实数据的基准测试(如电子健康记录)至关重要,因为临床决策直接依赖于这些数据源,而现有评估仍受限于医学考试式问题或基于 PubMed 文本的测试,无法真实反映实际临床数据的复杂性。另一些基准则仅聚焦于特定应用场景,限制了其在更广泛临床场景中的可泛化性。为此,我们提出 BRIDGE,一个涵盖 87 个任务的综合性多语言基准,数据来源于真实世界临床数据,覆盖九种语言。该基准涵盖八大任务类型,贯穿患者护理的六个临床阶段和 20 个典型应用,包括分诊与转诊、会诊、信息提取、诊断、预后和医保编码等,涉及 14 个临床专科。我们系统评估了 95 个大语言模型(包括 DeepSeek-R1、GPT-4o、Gemini 系列和 Qwen3 系列),并在各种推理策略下进行测试。结果显示,模型规模、语言、自然语言处理任务和临床专科之间存在显著的性能差异。值得注意的是,我们发现开源大语言模型的性能可与专有模型相当,而基于较旧架构进行医学微调的大语言模型往往表现不如更新的通用模型。BRIDGE 及其对应的排行榜为大语言模型在真实世界临床文本理解方面的开发与评估提供了基础资源和独一无二的参考。BRIDGE 排行榜:https://huggingface.co/spaces/YLab-Open/BRIDGE-Medical-Leaderboard

关键词

引用

@article{arxiv.2504.19467,
  title  = {BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text},
  author = {Jiageng Wu and Bowen Gu and Ren Zhou and Kevin Xie and Doug Snyder and Yixing Jiang and Valentina Carducci and Richard Wyss and Rishi J Desai and Emily Alsentzer and Leo Anthony Celi and Adam Rodman and Sebastian Schneeweiss and Jonathan H. Chen and Santiago Romero-Brufau and Kueiyu Joshua Lin and Jie Yang},
  journal= {arXiv preprint arXiv:2504.19467},
  year   = {2026}
}