中文

当案例稀少时:面向非指南临床问答的数据检索基准

计算与语言 2026-05-22 v1

摘要

在医学专科领域,临床实践以基于证据的指南为基础,这些指南编码了最常见的诊断和治疗路径。这些路径常常不足以覆盖指南未涵盖的长尾真实护理场景。然而,大多数医学大型语言模型(LLM),却被训练来编码常见的、以指南为导向的医学知识。当前的评估主要在记忆这些已编码内容的情境下进行,常以多选题形式进行。鉴于基于证据的推理在医学中的根本重要性,依赖记忆来应对临床实践既不可行,也不可靠。为此,我们引入OGCaReBench,一个以检索为导向的基准,旨在评估LLM在需要超越典型指南的临床问题上的表现。该基准从已发表的医学病例报告中提取,并由医学专家验证,包含需要自由文本答案的长形式临床问题,为评估稀有、基于案例的场景中的开放式医学推理提供了系统框架。我们的实验表明,即使是最好的基线模型(GPT-5.2)也仅能正确回答56%的该基准问题,专门的模型仅达到42%。通过引入检索到的医学文章,性能提升至最高可达82%(使用GPT-5.2),凸显了证据 grounding在实际医学推理任务中的重要性。这一工作为推动通用型和医学LLM在挑战性临床情境中提供可靠答案提供了基础。

关键词

引用

@article{arxiv.2605.21807,
  title  = {When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering},
  author = {Doeun Lee and Muge Zhang and Yi Yu and Ashish Manne and Stephen Koesters and Frank Wen and Brady Buchanan and Lynda Villagomez and Oluwatoba Moninuola and James Lim and Kathryn Tobin and Andrew Srisuwananukorn and Ping Zhang and Sachin Kumar},
  journal= {arXiv preprint arXiv:2605.21807},
  year   = {2026}
}

备注

34 pages, 20 figures