医疗 LLM 基准测试仅当其明确假设足够可靠时才可靠
计算机与社会
2026-05-22 v1 人工智能
机器学习
摘要
基准测试是医疗评估所必需的,但并非足以预测部署时的性能。我们的立场是,评估-部署之间的差距并非源于 poorly designed 的基准测试本身,而是源于关于用户如何与模型交互的隐式假设,这些假设无法从基准测试alone 暴露出来。为精确化此观点,我们将假设分为两类:任务类假设可仅从对话数据中测试,而结果类假设则需要结果数据和行为研究方面的测试。关键在于,结果类假设依赖于人类行为,即使设计良好的基准测试也无法直接观察。为演示此框架的可操作性,我们对一项医疗RCT进行回顾性分析案例研究,发现差距自然分为任务类差距和结果类差距,大小约为相等。为解决此问题,我们作出两项贡献:首先,我们提出BenchmarkCards以文档化假设;其次,我们提出分阶段评估程序,以系统性地测试假设并评估性能。
引用
@article{arxiv.2605.22612,
title = {Healthcare LLM Benchmarks Are Only as Good as Their Explicit Assumptions},
author = {Naveen Raman and Santiago Cortes-Gomez and Mateo Dulce Rubio and Fei Fang and Bryan Wilder},
journal= {arXiv preprint arXiv:2605.22612},
year = {2026}
}
备注
13 pages, 1 figure