中文

PanCanBench:评估大语言模型在胰腺癌领域综合基准

计算与语言 2026-03-03 v1 人工智能

摘要

大语言模型(LLM)已在标准化考试中达到专家水平,但多选题准确率不足以反映实际临床实用性和安全性。随着患者和临床医生日益使用LLM来获取复杂疾病如胰腺癌的指导,评估必须超越一般医学知识。现有框架(如HealthBench)依赖模拟查询,缺乏疾病特定的深度。此外,高分数并不确保事实正确性,亟需评估幻觉现象。我们构建了一个以人类为导向的管道,用于创建来自Pancreatic Cancer Action Network(PanCAN)的去标识化患者问题的专家评分标准。最终构建的基准包括282个真实患者问题及3,130个问题特定评估标准。我们评估了22个专有和开源LLM,采用LLM作为评判员框架,衡量临床完整性、事实准确性和网页搜索集成情况。模型在评分标准完整性方差异显著,得分范围为46.5%至82.3%。事实错误普遍存在,幻觉率(响应中包含至少一个事实错误的比例)范围从Gemini-2.5 Pro和GPT-4o的6.0%到Llama-3.1-8B的53.8%。重要的是,较新的优化推理模型并不总能提高事实正确性:虽然o3取得最高的评分标准得分,却比其他GPT系列模型更常产生错误。网页搜索集成并不必然保证更好的响应。Gemini-2.5 Pro的平均得分从66.8%变为63.9%,GPT-5的平均得分从73.8%变为72.8%。合成AI生成的评分标准平均将绝对得分提高17.9分,但通常保持相似的相对排名。

关键词

引用

@article{arxiv.2603.01343,
  title  = {PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology},
  author = {Yimin Zhao and Sheela R. Damle and Simone E. Dekker and Scott Geng and Karly Williams Silva and Jesse J Hubbard and Manuel F Fernandez and Fatima Zelada-Arenas and Alejandra Alvarez and Brianne Flores and Alexis Rodriguez and Stephen Salerno and Carrie Wright and Zihao Wang and Pang Wei Koh and Jeffrey T. Leek},
  journal= {arXiv preprint arXiv:2603.01343},
  year   = {2026}
}