ViTaB-A:评估多模态大语言模型的视觉表格属性
计算与语言
2026-02-18 v1
摘要
多模态大语言模型(mLLMs)常用于回答结构化数据(如Markdown、JSON和图像中的表格)的问题。尽管这些模型能够给出正确答案,用户仍需了解答案来源。本文研究结构化数据属性/引用,即模型指向支持答案的特定行和列的能力。我们在不同表格格式和提示策略下评估了多个mLLMs。结果显示,问答能力与证据属性能力存在明显差距。尽管问答准确率保持中等,属性准确率远低于随机水平(尤其是JSON输入),所有模型表现如此。我们还发现模型在引用行优于列,处理文本格式比图像时更具挑战性。最后,我们观察到不同模型家族之间存在显著差异。总体而言,当前mLLMs在提供结构化数据的细粒度可靠属性方面不可靠,这限制了其在需要透明性和可追溯性的应用中的使用。
引用
@article{arxiv.2602.15769,
title = {ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution},
author = {Yahia Alqurnawi and Preetom Biswas and Anmol Rao and Tejas Anvekar and Chitta Baral and Vivek Gupta},
journal= {arXiv preprint arXiv:2602.15769},
year = {2026}
}