ImageCLEF 2025 多模态推理:基于集成视觉语言模型的多语言多模态推理
计算与语言
2025-07-16 v1
摘要
我们提出了一种用于ImageCLEF 2025 EXAMS V挑战的基于集成的鲁棒系统,用于多语言多模态推理。该方法整合了Gemini 2.5 Flash用于视觉描述、Gemini 1.5 Pro用于标题优化和一致性检查,以及Gemini 2.5 Pro作为推理器处理最终答案选择,全部通过精心设计的少样本和零样本提示进行协调。我们进行了广泛的消融研究,训练了几种大型语言模型(Gemini 2.5 Flash、Phi 4、Gemma 3、Mistral)在英文数据集及其多语言增强版本上。此外,我们评估了Gemini 2.5 Flash在零样本设置下的表现,发现其在训练模型中显著优于训练好的模型。提示设计也证明至关重要:强制采用简洁、语言规范化的格式并禁止解释性文本,使模型在英文验证集上的准确率从55.9%提升至61.7%。在官方排行榜上,我们的系统(团队MSA)在多语言轨道中获得总体第一名,准确率为81.4%,并在11个中的13个语言轨道中领先,其中包括克罗维亚亚语95.07%和意大利语92.12%的顶尖结果。我们的发现表明,轻量级OCR-VLM集成如果配合精确的提示策略和跨语言数据增强,在高风险的多语言教育环境中,可以超过重型端到端模型。
引用
@article{arxiv.2507.11114,
title = {MSA at ImageCLEF 2025 Multimodal Reasoning: Multilingual Multimodal Reasoning With Ensemble Vision Language Models},
author = {Seif Ahmed and Mohamed T. Younes and Abdelrahman Moustafa and Abdelrahman Allam and Hamza Moustafa},
journal= {arXiv preprint arXiv:2507.11114},
year = {2025}
}