EpiQAL:流行病学问答与推理基准
计算与语言
2026-05-27 v3 人工智能
摘要
可靠的流行病学推理需要综合研究证据以推断疾病负担、传播动力学和干预效果。现有医学问答基准主要侧重临床知识或患者水平推理,鲜有系统评估以证据为基础的流行病学推理。我们提出 EpiQAL,首个覆盖多种疾病的流行病学问答诊断基准,包含三个子集源自公开文献。三个子集依次测试事实记忆、多步骤推理和在信息不完整情况下的结论重构,通过结合分类指导、多模型验证和难度筛选构建。十五个模型(包括开源和专有系统)的实验显示,当前 LLM 在流行病学推理方面表现有限,多步骤推理提出最大挑战。模型排名在不同子集间变化,规模alone不能预测成功。链式思维提示在多步骤推理中有益,但在其他情境下效果不一。EpiQAL 提供细粒度诊断信号,用于证据 grounding、推理推断和结论重构。
引用
@article{arxiv.2601.03471,
title = {EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning},
author = {Mingyang Wei and Dehai Min and Zewen Liu and Yuzhang Xie and Guanchen Wu and Ziyang Zhang and Carl Yang and Max S. Y. Lau and Qi He and Lu Cheng and Wei Jin},
journal= {arXiv preprint arXiv:2601.03471},
year = {2026}
}
备注
31 pages, 7 figures, 25 tables