基于多模态半结构化表格的知识感知推理
计算与语言
2024-08-27 v1 计算机视觉与模式识别
摘要
现有的表格问答数据集通常只关注单元格内的文本。然而,现实世界的数据本质上是多模态的,常常在表格中将符号、人脸、图标、图案和图表等图像与文本内容融合在一起。随着能够进行多模态推理的 AI 模型的发展,评估它们处理此类结构化数据的效能变得十分必要。本研究探讨了当前的 AI 模型能否对多模态结构化数据进行知识感知推理。我们探究了它们在整合了图像和文本的表格上进行推理的能力,并为此引入了 MMTabQA,一个专为这一目的设计的新数据集。我们的实验揭示了当前 AI 模型在有效整合与解释多个文本和图像输入、理解视觉上下文以及跨图像比较视觉内容方面面临的巨大挑战。这些发现确立了我们的数据集作为一个稳健的基准,用于推动 AI 在分析多模态结构化数据方面的理解和能力。
引用
@article{arxiv.2408.13860,
title = {Knowledge-Aware Reasoning over Multimodal Semi-structured Tables},
author = {Suyash Vardhan Mathur and Jainit Sushil Bafna and Kunal Kartik and Harshita Khandelwal and Manish Shrivastava and Vivek Gupta and Mohit Bansal and Dan Roth},
journal= {arXiv preprint arXiv:2408.13860},
year = {2024}
}