中文

MTVQA:面向多语言以文本为中心的视觉问答基准测试

计算机视觉与模式识别 2025-06-12 v5

摘要

以文本为中心的视觉问答 (TEC-VQA) 以其恰当的形式不仅促进了以文本为中心的视觉环境中的人机交互,还作为评估以文本为中心的场景理解领域中 AI 模型的事实上的黄金代理。尽管如此,大多数现有的 TEC-VQA 基准测试都集中在英语和中文等高资源语言上。尽管先前有开创性工作通过翻译引擎在非文本为中心的 VQA 数据集中扩展多语言问答对,但基于翻译的方案在应用于 TEC-VQA 时遇到了严重的“视觉-文本不对齐”问题。具体而言,它优先考虑问答对中的文本,而忽略了图像中存在的视觉文本。此外,它无法处理与细微含义、上下文扭曲、语言偏差和问题类型多样性相关的复杂性。在这项工作中,我们通过引入 MTVQA 来解决多语言 TEC-VQA 问题,这是第一个以 9 种不同语言提供高质量人类专家标注的基准测试,包含跨越 2,116 张图像的 6,778 个问答对。此外,通过在 MTVQA 基准测试上全面评估众多最先进的多模态大语言模型 (MLLM),包括 Qwen2-VL、GPT-4o、GPT-4V、Claude3 和 Gemini,结果表明性能仍有很大的提升空间(Qwen2-VL 得分为 30.9,而人类表现为 79.7),这凸显了 MTVQA 的价值。此外,我们在 MTVQA 数据集中提供了多语言训练数据,证明使用该数据进行简单的微调可以大幅提升多语言 TEC-VQA 性能。我们希望 MTVQA 能为研究界提供新的见解,并激发对多语言视觉文本理解的进一步探索。项目主页可在 https://bytedance.github.io/MTVQA/ 获取。

关键词

引用

@article{arxiv.2405.11985,
  title  = {MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering},
  author = {Jingqun Tang and Qi Liu and Yongjie Ye and Jinghui Lu and Shu Wei and Chunhui Lin and Wanqing Li and Mohamad Fitri Faiz Bin Mahmood and Hao Feng and Zhen Zhao and Yangfan He and Kuan Lu and Yanjie Wang and Yuliang Liu and Hao Liu and Xiang Bai and Can Huang},
  journal= {arXiv preprint arXiv:2405.11985},
  year   = {2025}
}

备注

Accepted by ACL 2025 findings