HEAD-QA v2:扩充医疗基准数据集以适应推理任务
计算与语言
2026-03-31 v2
摘要
我们介绍HEAD-QA v2,这是Vilares 和 G\'omez-Rodr\'iguez (2019) 于 2019 年发布的西班牙语/英语医疗多选题推理数据集的扩展版本。该更新回应了日益增长的需求,即需要捕捉医疗推理中语言和概念复杂性的高质量数据集。我们将数据集扩展到超过 12,000 题,涵盖十年西班牙专业考试,基准测试了多个开源大语言模型(LLM)通过提示、RAG 和概率-based 答案选择方式,并提供了额外的多语言版本以支持未来工作。结果表明,性能主要受模型规模和内在推理能力驱动,复杂推理策略仅带来有限的提升。综合这些结果,HEAD-QA v2 已被证明是推动医学推理研究和模型改进可靠资源。
引用
@article{arxiv.2511.15355,
title = {HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning},
author = {Alexis Correa-Guillén and Carlos Gómez-Rodríguez and David Vilares},
journal= {arXiv preprint arXiv:2511.15355},
year = {2026}
}
备注
LREC 2026 camera-ready version