巴哈斯印度尼语文档中的跨语言表格视觉问答基准:INDOTABVQA
计算机视觉与模式识别
2026-04-15 v1 人工智能
计算与语言
机器学习
摘要
我们提出 INDOTABVQA,一个用于评估巴哈斯印度尼语文档图像上跨语言表格视觉问答 (VQA) 的基准数据集。该数据集包含 1,593 张文档图像,分为三种视觉风格(带边框、无边框和彩色),每个文档包含一个或多个表格,以及 1,593 组问答数据,问答语言包括巴哈斯印度尼语、英语、 Hindi 和阿拉伯语。这使得能够在单语场景(巴哈斯印度尼语文档配巴哈斯印度尼语提问)和跨语言场景(巴哈斯印度尼语文档配其他语言提问)下,对视觉语言模型 (VLM) 进行评估。我们对领先的开源 VLM(Qwen2.5-VL、Gemma-3、LLaMA-3.2)以及 GPT-4o 进行基准测试,发现尤其在结构复杂表格和低资源语言方面表现显著差距。对该数据集进行微调的紧凑型 3B 模型和 LoRA 微调的 7B 模型分别在准确率上提升了 11.6% 和 17.8%。将显式表格区域坐标作为额外输入进一步提升性能 4-7%,表明空间先验条件对基于表格的推理具有重要价值。我们的发现凸显了语言多样性、领域特定数据集的重要性,并表明针对性微调可以显著提升 VLM 在专业文档理解任务中的性能。INDOTABVQA 为推动跨语言、结构感知文档理解研究,尤其是在世界上被低代表的地区,提供了宝贵资源。完整数据集可在 huggingface 上访问:https://huggingface.co/datasets/NusaBharat/INDOTABVQA
引用
@article{arxiv.2604.11970,
title = {INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents},
author = {Somraj Gautam and Anathapindika Dravichi and Gaurav Harit},
journal= {arXiv preprint arXiv:2604.11970},
year = {2026}
}
备注
Accepted in ACL 2026 (Findings)