CareMedEval数据集:评估生物医学领域的批判性评价与推理能力
计算与语言
2026-03-05 v3 人工智能
摘要
对科学文献的批判性评价是生物医学领域的一项基本技能。虽然大型语言模型(LLMs)可以在这一任务中提供有前景的支持,但其可靠性仍然有限,尤其是在专业领域的关键推理方面。我们引入了 CareMedEval,这是一个原创数据集,旨在评估 LLMs 在生物医学批判性评价和推理任务上的表现。该数据集源自法国医学生的真实考试,包含基于 37 篇科学文章的 534 个问题。与现有基准不同,CareMedEval 明确评估基于科学论文的批判性阅读和推理。在各种上下文条件下对最先进的通用型和生物医学专用型 LLMs 进行基准测试,揭示了该任务的难度:开放和商业模型未能超过 0.5 的精确匹配率,尽管生成中间推理标记显著改善了结果。然而,模型在关于研究局限性和统计分析的问题上仍然面临挑战。CareMedEval 为基于文本的推理提供了一个具有挑战性的基准,揭示了当前 LLMs 的局限性,并为未来开发批判性评价的自动化支持铺平了道路。
引用
@article{arxiv.2511.03441,
title = {CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field},
author = {Doria Bonzi and Alexandre Guiggi and Frédéric Béchet and Carlos Ramisch and Benoit Favre},
journal= {arXiv preprint arXiv:2511.03441},
year = {2026}
}
备注
Accepted at LREC 2026. To access the dataset, see https://github.com/bonzid/CareMedEval