Cancer-Myth:在带有错误预设的患者问题上评估大语言模型
计算与语言
2025-11-03 v3 计算机与社会
摘要
癌症患者日益转向大语言模型(LLMs)以获取医学信息,因此评估这些模型处理复杂且个性化问题的能力至关重要。然而,现有的医学基准主要聚焦于医学考试或消费者搜索式问题,并未在带有患者真实信息的真实患者问题上对 LLM 进行评估。本文首先邀请三位血液肿瘤科医生评估取自真实患者的癌症相关问题。尽管 LLM 的回答总体准确,但模型常常无法识别或回应问题中的错误预设,这对安全的医疗决策构成风险。为系统地研究这一局限,我们构建了 Cancer-Myth——一个由专家验证的对抗性数据集,包含 585 道带有错误预设的癌症相关问题。在该基准上,没有任何前沿 LLM——包括 GPT-5、Gemini-2.5-Pro 与 Claude-4-Sonnet——能够以超过 的比例纠正这些错误预设。为研究缓解策略,我们进一步构建了一个包含 150 道问题的 Cancer-Myth-NFP 数据集,其中医生确认问题中不存在错误预设。我们发现,典型的缓解策略(例如加入带 GEPA 优化的预防性提示)可将 Cancer-Myth 上的准确率提升至 ,但代价是在 的 Cancer-Myth-NFP 问题中误判预设的存在,并在其他医学基准上造成 的相对性能下降。这些发现揭示了 LLM 可靠性方面的一个关键缺口,表明仅靠提示工程并非应对错误预设的可靠补救手段,并凸显了在医学 AI 系统中构建更稳健安全保障的必要性。
引用
@article{arxiv.2504.11373,
title = {Cancer-Myth: Evaluating Large Language Models on Patient Questions with False Presuppositions},
author = {Wang Bill Zhu and Tianqi Chen and Xinyan Velocity Yu and Ching Ying Lin and Jade Law and Mazen Jizzini and Jorge J. Nieva and Ruishan Liu and Robin Jia},
journal= {arXiv preprint arXiv:2504.11373},
year = {2025}
}