EuropeMedQA 研究方案:面向语言模型评估的多语言、多模态医学考试数据集
计算与语言
2026-04-27 v2 人工智能
摘要
虽然大型语言模型(LLM)在以英语为中心的医学考试中展现出高水平能力,但在面对非英语语言和多模态诊断任务时,性能常常下降。本研究方案描述了开发EuropeMedQA的过程,这是首个来自意大利、法国、西班牙和葡萄牙官方监管考试的全面、多语言、多模态医学考试数据集。遵循FAIR数据原则和SPIRIT-AI指南,我们描述了严格的修订过程和自动翻译管道,以进行比较分析。我们使用零样本、严格受限的提示策略评估当代多模态LLM,以评估跨语言迁移和视觉推理。EuropeMedQA旨在提供一个防止数据污染的基准,反映欧洲临床实践的复杂性,并促进更通用医学AI的发展。
引用
@article{arxiv.2604.14306,
title = {EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation},
author = {Francesco Andrea Causio and Vittorio De Vita and Olivia Riccomi and Michele Ferramola and Federico Felizzi and Alessandro Tosi and Antonio Cristiano and Lorenzo De Mori and Chiara Battipaglia and Melissa Sawaya and Luigi De Angelis and Marcello Di Pumpo and Alessandra Piscitelli and Pietro Eric Risuleo and Alessia Longo and Giulia Vojvodic and Mariapia Vassalli and Bianca Destro Castaniti and Nicolò Scarsi and Manuel Del Medico},
journal= {arXiv preprint arXiv:2604.14306},
year = {2026}
}