VMMU:一个越南语多任务多模态理解与推理基准
计算与语言
2026-01-26 v4 机器学习
摘要
我们介绍 VMMU,一个越南语多任务多模态理解与推理基准,旨在评估视觉语言模型(VLMs)如何理解和推理视觉与文本信息,超越英语。VMMU 包含 2500 条多模态问题,覆盖 7 项任务,涉及 STEM 问题解决、数据解读、规则驱动的视觉推理和抽象视觉推理等多样化的情境。所有问题都要求真正的多模态集成,而非依赖文本-only 提示或基于 OCR 的捷径。我们对一套最先进的专有和开源 VLMs 在 VMMU 上进行评估。尽管越南语 OCR 性能强劲,但专有模型仅 achieving 66% 的平均准确率。进一步分析显示,失败的主要来源并非 OCR,而是来自文本与视觉证据之间的多模态 grounding 和推理。代码和数据可在 https://vmmu-bench.github.io/ 获取。
引用
@article{arxiv.2508.13680,
title = {VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark},
author = {Vy Tuong Dang and An Vo and Emilio Villa-Cueva and Quang Tau and Duc Dm and Thamar Solorio and Daeyoung Kim},
journal= {arXiv preprint arXiv:2508.13680},
year = {2026}
}