中文

医学大语言模型基准测试应优先考虑构要有效性

计算与语言 2025-03-17 v1

摘要

医学大语言模型 (LLM) 研究常常提出宏大的主张,从编码临床知识到像医生一样进行推理。这些主张通常依赖于竞争性基准测试的评估;这种传统继承自主流机器学习。但我们如何区分真正的进步与排行榜的炫耀?医学 LLM 基准测试就像其他领域的基准测试一样,是任意构建的,常使用医学执照考试问题。为了真正衡量进展,这些基准测试必须准确捕捉旨在代表的真实世界任务。在本 position paper 中,我们主张医学 LLM 基准测试应(并且可以)进行经验性构要有效性评估。在心理学测试文献中,"构要有效性"指测试衡量 underlying "construct"的能力,即实际概念目标的评估能力。通过将 LLM 基准测试与心理测试类比,我们解释了来自该领域的框架如何为验证基准测试提供经验基础。为将这些想法付诸实践,我们使用真实世界临床数据进行 proof-of-concept 实验,评估了流行的医学 LLM 基准测试并报告了其构要有效性存在显著缺口。最后,我们概述了以建立有效基准测试为中心的医学 LLM 评估新生态系统的愿景。

关键词

引用

@article{arxiv.2503.10694,
  title  = {Medical Large Language Model Benchmarks Should Prioritize Construct Validity},
  author = {Ahmed Alaa and Thomas Hartvigsen and Niloufar Golchini and Shiladitya Dutta and Frances Dean and Inioluwa Deborah Raji and Travis Zack},
  journal= {arXiv preprint arXiv:2503.10694},
  year   = {2025}
}