WorldMedQA-V:面向多模态语言模型的多语言、多模态医学考试数据集
计算与语言
2024-10-17 v1
摘要
多模态/视觉语言模型 (VLM) 正在全球范围内在医疗保健领域部署,亟需稳健的基准测试以确保其安全、有效性和公平性。源自各国医学考试的多选问答数据集长期以来一直是宝贵的评估工具,但现有数据集主要为文本唯一且仅面向有限的语言和国家。为此,我们提出 WorldMedQA-V,一个更新的多语言、多模态基准数据集,用于评估 VLM 在医疗保健领域的表现。WorldMedQA-V 包括 568 个标记的多选问答,配有 568 张医学图像,来自四个国家(巴西、以色列、日本和西班牙),涵盖原始语言和经本土临床医生验证的英文翻译。提供常见开放和闭源模型的基线性能,分别以当地语言和英文翻译,以及是否提供图像。WorldMedQA-V 基准旨在更好地匹配部署其中的 AI 系统所处的多样化医疗环境,促进更公平、更有效和更具代表性的应用。
引用
@article{arxiv.2410.12722,
title = {WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation},
author = {João Matos and Shan Chen and Siena Placino and Yingya Li and Juan Carlos Climent Pardo and Daphna Idan and Takeshi Tohyama and David Restrepo and Luis F. Nakayama and Jose M. M. Pascual-Leone and Guergana Savova and Hugo Aerts and Leo A. Celi and A. Ian Wong and Danielle S. Bitterman and Jack Gallifant},
journal= {arXiv preprint arXiv:2410.12722},
year = {2024}
}
备注
submitted for review, total of 14 pages