中文

MedBench-IT:评估大语言模型在意大利医学入学考试中的综合基准

计算与语言 2025-09-10 v1

摘要

大语言模型(LLM)在教育领域展现出越来越大的潜力,但针对非英语语言的专业领域基准仍然稀缺。我们介绍了MedBench-IT,这是首个用于评估LLM在意大利医学大学入学考试中表现的综合基准。MedBench-IT的数据来源于领先的备考材料出版社Edizioni Simone,包含17,410道专家编写的多项选择题,涵盖六个学科(生物、化学、逻辑、通识文化、数学、物理)和三个难度级别。我们评估了多种模型,包括专有LLM(GPT-4o、Claude系列)和注重实际可部署性的资源高效开源替代方案(<30B参数)。除了准确率,我们还进行了严格的可重复性测试(88.86%的响应一致性,因学科而异)、顺序偏差分析(影响极小)和推理提示评估。我们还检查了问题可读性与模型性能之间的相关性,发现了一个具有统计显著性但较小的负相关关系。MedBench-IT为意大利NLP社区、教育科技开发者和从业者提供了重要资源,为这一关键领域的当前能力和标准化评估方法提供了见解。

关键词

引用

@article{arxiv.2509.07135,
  title  = {MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations},
  author = {Ruggero Marino Lazzaroni and Alessandro Angioi and Michelangelo Puliga and Davide Sanna and Roberto Marras},
  journal= {arXiv preprint arXiv:2509.07135},
  year   = {2025}
}

备注

Accepted as an oral presentation at CLiC-it 2025