LLM 在回答孟加拉语医学视觉问答上的表现如何?数据集与基准测试
计算与语言
2026-05-19 v1 计算机视觉与模式识别
摘要
大型语言模型(LLM)和大型视觉语言模型(LVLM)的最新进展使通用系统能够在复杂推理任务中展现出令人瞩目的能力,包括医学领域的任务。医学视觉问答(MedVQA)尤其受益于这些发展。然而,尽管孟加拉语是全球使用最广泛的语言之一,但目前尚不存在针对该语言的成熟 MedVQA 基准。为了填补这一空白,我们引入了 BanglaMedVQA,一个包含临床验证的图像-问题-答案对的数据集,并在此资源上对当前基础模型进行了全面评估。与先前报告当前模型在英文 MedVQA 基准上性能较低的发现一致,我们的分析表明,孟加拉语上的性能大幅降低,反映了低资源语言固有的挑战。即使是 Gemini 和 GPT-4.1 mini 等表现最佳的模型也无法准确回答专业的诊断问题,表明其在细粒度医学推理方面存在严重局限。尽管某些开源模型(如 Gemma-3)在通用类别上偶尔优于这些模型,但它们在临床复杂问题上同样面临困难,凸显了对顶尖评估方法的迫切需求。
引用
@article{arxiv.2605.18111,
title = {How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking},
author = {Rafid Ahmed and Intesar Tahmid and Mir Sazzat Hossain and Tasnimul Hossain Tomal and Md Fahim and Md Farhad Alam Bhuiyan},
journal= {arXiv preprint arXiv:2605.18111},
year = {2026}
}
备注
14 pages, 7 figures, 5 tables, Proceedings of The Second AAAI Bridge Program on AI for Medicine and Healthcare, PMLR 317:1-14, 2026