多语言视觉语言模型是否等价推理?针对印度语言的跨语言视觉推理审计
计算与语言
2026-03-31 v1 机器学习
摘要
视觉语言模型在数学、科学和空间推理基准测试中表现良好,但这些评估几乎全部是英文。我提出首个针对印度语言的跨语言视觉推理审计。将 MathVista、ScienceQA 和 MMMU 中的 980 个问题翻译成印地语、泰米尔语、泰卢固语、孟加拉语、卡纳达语和马拉里语,使用 IndicTrans2 进行翻译,对 50 个样本进行 Gemini 2.0 Flash 交叉验证(翻译间一致性 0.79-0.84)。对 8 个视觉语言模型(从 7B 的开源模型到 GPT-4o)进行评估,产生 68,600 条推理记录,包括文本-only 和链式推理 ablation。我发现从英文切换到印度语言时,准确率下降 9.8-25 个百分点,其中 Dravidian 语言的下降幅度可达 13.2 个百分点。链式推理提示在孟加拉语 (-14.4 pp) 和卡纳达语 (-11.4 pp) 的表现反而下降,暴露了以英文为中心的推理链。Aya-Vision-8B 虽为 23 种语言构建,仍在 Dravidian 脚本上下降 28.5 pp;多语言预训练本身并不能传递视觉推理能力。我发布了翻译后的基准数据集和所有模型输出。
引用
@article{arxiv.2603.26742,
title = {Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages},
author = {Swastik R},
journal= {arXiv preprint arXiv:2603.26742},
year = {2026}
}
备注
16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning