中文

MediQAl: 用于知识与推理评估的法语医学问答数据集

计算与语言 2026-05-19 v1 人工智能

摘要

本文介绍了MediQAl,一个法语医学问答数据集,旨在评估语言模型在事实性医学回忆和真实临床场景推理方面的能力。MediQAl包含来自41个医学学科的法国医学考试的32,603个问题。该数据集包括三项任务:(i) 单选题,(ii) 多选题,以及 (iii) 开放式简答题。每个问题被标记为理解或推理,从而能够对模型的认知能力进行详细分析。我们通过使用14个大语言模型(包括最近的推理增强模型)进行广泛评估来验证MediQAl数据集,并观察到事实回忆任务与推理任务之间存在显著的性能差距。我们的评估为评估语言模型在法语医学问答上的表现提供了一个全面的基准,填补了医学领域多语言资源中的一个关键空白。

关键词

引用

@article{arxiv.2507.20917,
  title  = {MediQAl: A French Medical Question Answering Dataset for Knowledge and Reasoning Evaluation},
  author = {Adrien Bazoge},
  journal= {arXiv preprint arXiv:2507.20917},
  year   = {2026}
}